メインコンテンツへスキップ
見出し画像

AIニュース+αまとめ@2025年4-5月

     最近のAI事情をキャッチアップするためのまとめ記事です。
     自分用で作成しているため情報の偏りや漏れなどあります。

    1.最新LLM一覧

     過去の記事で大規模言語モデル(LLM)を紹介しました。

     現在では下記AIサービス(※チャットだけでなく画像生成など多機能なためサービスと表現しました)があります。各サービスで自然言語処理によるテキスト生成、会話応答、文章要約、翻訳など多岐にわたるタスクに対応します。

    1. GhatGPT:OpenAIが開発した大規模言語モデル。多機能であり、他サービスに比べて万能

    2. Claude:Anthropicが開発した次世代AIアシスタントであり、ユーザーが最適な形で作業できるように安全、正確、セキュリティ面のトレーニングを受けている。

      • 無料で使用できるが回数制限あり。

      • Anthropicが発表したModel Context Protocol(MCP)により、AI と外部システムの接続の標準化が可能

    3. Grok:​xAI(イーロン・マスク氏が設立)が開発したAIモデルで、テキスト生成や質問応答などのタスクにおいて高い性能を示します。

      • X(Twitter)でも利用可能

    4. Gemini:Googleが開発した大規模言語モデルであり、BardからGeminiへ名称変更されました。ChatGPTに劣らず万能であり、一部のタスクに関してはより優れた性能を発揮します

    5. Perplexity:AIスタートアップ企業Perplexity AI, Inc.により2022年に公開された無料のAI検索エンジンであり、質問するとインターネットを検索して回答を提供

      • 通常のLLMは学習した結果しか回答できないが、Perplexityはリアルタイム検索( 最新のウェブ情報を基に)回答を生成します

    6. DeepSeek:中国のDeepSeek社が開発した生成AIで、スマートフォンアプリ・Webアプリ・APIを通じて利用できます(出典:話題の「DeepSeek」を利用してみる)。

      • 個人的には①中国企業でセキュリティーが怪しい、②OpenAIのアウトプットデータを不正使用した疑いがある ので使用は様子見

      • 2025年1月27日にDeepSeekが「低コストで生成AIモデルを開発」したと発表し、NVIDIAの株価は17%安となり他社の株価も大きく値下がりした。理由として「高価な高性能GPUが必ずしも必要なくなったのでは?」と推測されたためらしいです

    7. Llama:Llama(Large Language Model Meta AI)Meta社が開発した大規模言語モデルです。​

      1. オープンソースでありGitHubにも公開

      2. 2025年4月5日にLlama4が公開(参考:Llama 4 の概要)

      3. 主観として、Meta社は他にもSAM 2: Segment Anything in Images and Videosなど多くのオープンソースを出している印象がある

    画像
    https://x.com/petergyang/status/1906007718961492391( @petergyang)

    1-1.GPTs(カスタムChatGPT)

     2023年11月6日「Introducing GPTs」より、OpenAIからGPTsがリリースされました。GPTs(カスタムGPT)とは特定の目的・タスク向けにカスタマイズしたChatGPTのことであり、誰でもノーコードでオリジナルのGPTを作成・共有できるようになりました(Creating a GPT-How to create a GPT)。
    ※GPTsはちょっと下火になってきてる気がします。

    【作成フロー】
     公式のGPTsの作成フローは以下の通りです。

    1. GPT Builderの起動:

    2. タブ設定(”作成する(Create)”と”構成(Configure)”):

      • Createタブ:GPT Builderに新しいGPTを作るようメッセージを送ることができます。下記は事例です。

        • 「新商品のビジュアル作成を手伝ってくれるクリエイターを作ってください 」

        • 「私のコードのフォーマットを手伝ってくれるソフトウェアエンジニアを作ってください 」

      • Configureタブ:GPTの名前と説明を設定できます。他にも、下記追加できます。

        • ウェブの閲覧

        • 画像の作成

        • 説明や会話のきっかけ

        • GPTに取ってもらいたい行動

    3. GPTの公開:

      • 公開準備が出来たら”Publish”を選択し、他の人と共有する

      • 公開範囲は自分だけ、組織内、全ユーザーなど選択可能

      • GPTストアに登録して公開可(Introducing the GPT Store)

    【最新の機能】
     「2025年3月25日 4o Image Generation が登場」より、GPTs内でも画像生成機能が使用できるようになりました。

    【注意点】
     他の人が作成した便利なGPTsを使用できる反面、セキュリティリスクも存在します。利用側は下記対策が必要となります。

    • 信頼できないGPTsを利用しない

    • GPTsに重要情報を入力しない

    • GPTsが通信する外部サーバを検証する

    • GPTsが表示するダウンロードリンクのURLを検証する

    1-2.Claude

     Claudeは、Anthropic社が開発した大規模言語モデルを用いた対話型生成AIです。提供モデルは下記の通りであり性能は「Opus > Sonnet > Haiku」の順になっています。

    画像
    Anthropic社のモデル比較表

    【新機能:Integrations と Advanced Research@2025年5月2日】
     Claudeから新たに2つの機能がリリースされました(Claude can now connect to your world)。

    1.Integrations 
     
    ClaudeはWebアプリやデスクトップアプリを介してリモートMCPサーバとシームレスに連携できるようになる

    2.Advanced Research
     
    数百もの社内外のソースを詳細に調査し、5分から45分でより包括的なレポートを作成

    Today we're announcing Integrations, a new way to connect your apps and tools to Claude.

    We're also expanding Claude's Research capabilities with an advanced mode that searches the web, your Google Workspace, and now your Integrations too. pic.twitter.com/zSvPBZYq43

    — Anthropic (@AnthropicAI) May 1, 2025

    【新モデル:Introducing Claude 4@2025年5月23日】

    1-3.Llama

     Meta社がLlama APIのプレビューを開始。まだUSユーザーのみだが、今後に期待。

    2.重要AIキーワード

     個人的に重要と感じたAIのキーワードを取り上げます。

    2-1.Deep Research

     Deep Researchを提供しているAIサービス一覧は下記の通り。
     Deep Researchが何なのかが分かりにくいですが、特徴として(多分)①Webブラウズ機能あり、②結果を分析・解釈してくれる、③レポートでまとめてくれる 機能があるところだと思います。

    1. Open AI:Introducing deep

      • ChatGPTは何百ものオンライン情報を探索・分析・合成し、リサーチャーレベルの総合的なレポートを作成します。

      • ウェブブラウジングとデータ分析に最適化されたOpenAI o3モデルを搭載し、推論を活用してインターネット上の大量のテキスト、画像、PDFを検索、解釈、分析します。

    2. Gemini:Gemini Deep Research

      • あらゆる物事について理解を深めることができます。ユーザーの代わりに数百ものウェブサイトを自動的に参照し、得られた結果を分析して、複数のページで構成される分析情報のレポートを作成してくれます。

    3. Perplexity:Introducing Perplexity Deep Research

      • 理由を含んだリサーチ:検索とコーディング機能を備えたPerplexityのディープリサーチモードは、繰り返し検索を行い、ドキュメントを読み、次に何をすべきかを推論し、対象分野についてより深く学ぶにつれてリサーチプランを洗練させていきます。

      • レポート作成:調査結果をまとめてレポートにします

      • エクスポート&共有: 最終レポートをPDFやドキュメントにエクスポートしたり、Perplexity Pageに変換して共有できます

    4. Grok:Grok Agents: Combining Reasoning and Tool Use

      • Grokでは名称は「DeepSearch」

      • DeepSearchは重要な情報を合成し、相反する事実や意見を推論し、複雑さから明快さを抽出するように設計されています。DeepSearchはリアルタイムの情報でも収集でき、最終的な要約は簡潔で包括的なレポートにまとめられます。

    5. felo AI:日本のスタートアップ企業であるSparticle株式会社が開発したAI検索エンジン

    2-2.MCP(Model Context Protocol)

     MCP(Model Context Protocol)の詳細は下記の通り。RAG (Retrieval-augmented generation:検索拡張生成)というキーワードがありますが、MCPは広義のRAGみたいなものらしいです。

     今までローカルアプリを触れたのはOpen Interpreterくらいであり、それ以降で全然情報がとれてなかった。

     MCPを使用すると所定のアプリをローカルで動作させることができ、生成AIと組み合わせることでテキストからアプリを操作して自分が欲しいものが作成できる。
     下記事例を見ると、例としてテキストからCAD図面を製造することもできそうでかなりワクワクする!

     他にもこんな記事もありましたのでご参考までに

    3.ツール/サービス

    3-1.ノートブック

     3-1ー1.Google NotebookLM

     3-1ー2.Obsidian

     ノートやメモをMarkdown形式で書けて、そのデータを手元のパソコン上に保存できるアプリケーション

     使いこなすとこのようにできるみたいです。

     3-1-3.Notion

     ドキュメント作成用アプリ

    画像

    3-2.スライド作成ツール

     PowerPointのようなスライドも※作成できるツールは以下の通り。
    ※一部ツールは多機能でありスライド以外のドキュメントも作成可能

     こちらはあくまで参考用

     3-2-1.Marp

     3-2-2.Quatro

     3-2-3.Slidev

    3-3.IDE(統合開発環境)

     私は普段GitHub Copilotを使うためにVS Codeを使用していますが、よりAIを使いこなすために他のIDEもあるみたいです。

     3-3-1.GitHub Copilot

     3-3-2.Windsurf AI


    画像
    https://windsurf.com/pricing
    画像

     3-3-3.Cursor

     3-3-4.Replit

     ブラウザ上での操作が可能な統合開発環境(IDE)

    3-4.検索ツール

     3-4-1.Genspark

    https://www.genspark.ai/

    4.自律型AIエージェント

    エージェント一覧

    使用する場合のコツ

    4-1.OpenAI Codex(Open AI)

     「Introducing Codex@May 16, 2025」より公開

    4-2.Devin(Cognition)

    4-3.Manus(Monica)

    4-4.Jules(Google)

    5.動画生成

     2022年8月の記事で画像生成を紹介しました。
    ※現在はDALL-E2の後継として「DALL-E3」が公開されており、ChatGPT内に組み込まれているためユーザーは無料で使用できます。

     2025年現在では既に動画生成AI(text-to-video)が公開されており、サービスの一部は下記の通りです。

    • Sora:​OpenAIが提供するテキストから動画を生成するAIモデル

    • Movie Gen:Meta社が開発したテキストからビデオ作成するAI

    • Runway Gen-3:Runway AI社が2024年7月に発表した動画生成AI

    • Luma Dream Machine:Luma AIが開発した動画生成ツール

    • InVideo:InVideo社のAIツール

    • Pika:Pika Labsが提供するAI動画生成サービス

    6.音声認識

     2022年にリリースされた Whisper以降であまり情報が入ってない・・・・

    https://openai.com/ja-JP/index/whisper/

    7.その他AIサービス

     いくつか目についたAIサービスを並べてみました。

    1. Runway:動画生成AI

    2. Tripo:3Dモデルを生成

    3. Cursor:AIを活用したコードエディタ

    4. Dify:ノーコードで生成AIアプリをつくれる

    5. Cline:Cline Bot Inc.社が開発したAIを活用した開発者支援ツール

    6. LangChain:LLMを用いたアプリケーション開発を効率的に行うためのライブラリ

    Runway

    Tripo

    Dify

    Cline

    LangChain

    8.雑多

     AI関係ないけど面白そうな情報

     ユニクロのお会計にも使用されているRFID(Radio Frequency Identification)とは別でBluetoothセンサータグというものが出てるらしい。結構興味あり!



    あとがき

     似たようなサービスが大量に出てて見るの止めてたら、いつの間にか浦島太郎/茹でガエル状態

     
     

    KIYO

     
     
    普段は製造業で企画/開発/設計しております。記事はプログラミング・機械学習、IoT関係の記事をメインで作成し、なるべく1つの記事で知りたいことを網羅していきます。内容は学術的より実装・アウトプット(ほしくなるもの)を重視して作成しています。 面白そうな仕事があればやりたいです!

    あなたへのおすすめ