メインコンテンツへスキップ
見出し画像

Gemini3.0 Pro×製造業への活用


    1.概要

     2025年11月18日に公開されたGemini 3 Proは複雑な問題を解決できる、Google の最も高度な推論 Gemini モデルです。
     Gemini 3 Pro は100 万トークンのコンテキスト ウィンドウにより、テキスト、音声、画像、動画、PDF、さらにはコード リポジトリ全体など、さまざまな情報ソースからの膨大なデータセットや困難な問題を理解できます。

     以前紹介したAIでは実現できなかった、製造業で働く人にも活用できるアイデアを共有します。


    2.製造業の業務

     製造業/ものづくりにおいて、自分が経験した業務×AI活用の可能性を書いてみました。

    画像

    3.Free and Open Source Software

     FOSS (Free and Open Source Software) とは、以下の2つの要素を併せ持つソフトウェアの総称です。

    1. Free Software: ユーザーが目的を問わず実行、コピー、配布、研究、変更、改良する自由を持つこと(Free Software Foundation)。

    2. Open Source: ソースコードが公開されており、誰でも利用・修正が可能であること(Open Source Initiativeによる定義)。

     製造業ではドキュメントや製図、シミュレーションなど様々な業務があります。必要なOUTPUTを出すためのソフトウェアを適切に選択し、使いこなすことが重要となります。

     下記はソフトウェアの参考記事です(情報量が少ないので追って更新)。


    4.Gemini-Canvasガイド

     下記記事参照のこと


    5.Geminiでできること-概要

     Geminiはコード生成が得意なので、Pythonコードは簡単に作成できます。Pythonでできることは下記参照。

     Gemini単体でも下記のようなことが可能です。次章からハンズオン形式で紹介します。

    • 調査 

    • 作図

    • 3Dデータ生成

    • ドキュメント処理

    • 可視化

     なお企画や課題発見の壁打ち相手は、今のところはまだ相手になるプロンプトを作れませんでした。


    6.QuickStart:調査

    情報収集

     Googleの検索能力と推論能力を掛け合わせた「Deep Research」は、市場調査や技術調査の工数を劇的に削減します。

    画像

     プロンプトのコツは以下のようなことをを明確に指定すること。

    • 意思決定に必要な情報を具体的に:コスト、性能、法規制、実績

    • 出典元のキーワード:技術系なら”論文”、”特許”、一次情報等


    7.QuickStart:ポンチ絵

    フロー図・図解:Draw.io

     作図ツールのDraw.io(現在は diagrams.net)は、無料・高機能・ブラウザだけでサクサク動き、下記を簡単に作成できます。

    • フローチャート(業務フローなど)

    • ネットワーク構成図(AWSやAzureのアイコンも標準搭載)

    • UML・ER図(システム設計図)

    • 組織図・マインドマップ

     データをXML形式で保持するため、AIに「Draw.ioで読めるXML形式」を書かせれば、手作業ゼロで一発で作図できます。

     基本的には下記プロンプトを使用し、特化型向けは個別にプロンプトを記載しました。Canvasの出力から直接コピペできない場合は、一度メモ帳に落としてからコピペするとうまくいくことがあります。

    # Role
    あなたは Draw.io (diagrams.net) の内部構造とXML仕様を完全に理解しているエキスパートエンジニアです。画像を解析し、Draw.ioでエラーなく読み込め、かつ編集可能な高品質なXMLコードを作成することが使命です。
    
    # Task
    添付画像を解析し、Draw.ioで完全に再現可能な未圧縮のXMLコードを出力してください。
    
    # 処理フロー
    誤ったXMLや読み込みエラー(特に mxPoint 関連)を防ぐため、以下のステップを厳守して思考・出力してください。
    
    ## Step 1: 構造分析と仕様策定(中間思考)
    画像を詳細に分析し、以下の情報を日本語でリストアップしてください。
    
    ### ノード詳細 (Nodes)
    - すべての図形要素を抽出し、ID(ID-1, ID-2...)を付与。
    - Label: テキスト内容(改行位置も意識すること)。
    - Shape: 図形形状(Rectangle, Ellipse, Rhombus, Text, Container, Swimlaneなど)。
    - Style: 色、枠線の種類(実線/点線)、フォントスタイル。
    
    ### 接続詳細 (Edges)
    - すべての線を抽出。
    - Connection: Source ID -> Target ID。
    - Type: 接続線か、単なる装飾的な線か。
    - Arrow: 矢印の向き(始点なし/終点あり、両端ありなど)。
    
    ### レイアウト戦略 (Geometry)
    - キャンバス上の絶対座標(x, y)とサイズ(width, height)の概算。
    - ノード間の相対的な位置関係と余白設定。
    
    ## Step 2: XMLコーディング(出力生成)
    Step 1に基づき、Draw.io XMLを生成します。以下の**【重要技術制約】**を絶対に遵守してください。
    
    ### 【重要技術制約・出力要件】(遵守必須)
    
    #### 1. 形式と構造
    - `<mxfile host="Electron" ... type="device">` から始まる完全なXML形式であること。
    - `mxGraphModel` 内に `root`、その中に `mxCell id="0"` と `mxCell id="1" parent="0"` を必ず含めること。
    
    #### 2. エッジ(線)の構文ルール(★最重要・エラー防止)
    `Could not add object mxPoint` エラーを防ぐため、`<mxGeometry>` 内の記述ルールを厳守すること。
    
    - **接続線の場合**: `source` と `target` 属性でノードIDを指定することを最優先する。
    - **座標で線を引く場合**(source/target属性を使わない場合):
        - `<mxPoint>` タグを使用する際は、必ず `as` 属性をつけること。
        - 始点: `<mxPoint x="..." y="..." as="sourcePoint" />`
        - 終点: `<mxPoint x="..." y="..." as="targetPoint" />`
        - **禁止事項**: `as` 属性のない `<mxPoint>` を `mxGeometry` の直下に配置してはならない。
    - **経路点(Waypoints)**:
        - 線を曲げるための中間点は、必ず `<Array as="points">` タグの中に `<mxPoint x="..." y="..." />` (ここでは as 不要)として記述すること。
    
    #### 3. テキストのエスケープ
    ラベル(value属性)内の特殊文字は正しくXMLエスケープすること。
    
    - `&` → `&amp;`
    - `<` → `&lt;`
    - `>` → `&gt;`
    - `"` → `&quot;`
    - 改行 → `&#xa;`
    
    #### 4. 座標系 (Geometry)
    - 要素が重ならないよう、余裕を持った `x`, `y`, `width`, `height` を設定すること。
    - 親要素(Container)がある場合、子要素の座標は親からの相対座標ではなく、絶対座標で計算するか、`relative="1"` の挙動を正しく理解して記述すること(通常は絶対座標推奨)。
    
    #### 5. スタイル (Style)
    - 可能な限り元のデザインを再現すること(`rounded=1`, `whiteSpace=wrap`, `html=1`, `fillColor=...` 等)。
    - 手書き風の場合は `comic=1`、影付きは `shadow=1` などを活用する。
    
    # Output Format
    Step 1の分析結果を出力した後、コードブロック内にStep 2のXMLコードのみを出力してください。

    【図解:Transformerアーキテクチャ】
     XMLからDraw.ioにコピペで図解できるか検証しました。
     Transformerアーキテクチャ図を再現するDraw.io用のXMLコードを作成します。プロンプトは安定のため今回向けの特化型で作成しました。

    あなたはDraw.io(diagrams.net)のエキスパートです。
    以下の要件に従い、添付画像のような「Transformerモデルのアーキテクチャ図」を再現するDraw.io用のXMLコードを作成してください。
    
    【出力要件】
    1. **非圧縮(Uncompressed)のXML形式**で出力すること(`<mxGraphModel>`から始まるコード)。
    2. 要素の配置座標(geometry x, y)を慎重に計算し、図形が重ならないようにすること。
    
    【図の構成指示】
    図は大きく分けて「左側:Encoder(エンコーダー)」と「右側:Decoder(デコーダー)」の2列構成です。
    ### 1. カラーパレット(近似色を使用)- Input/Output Embeddings: 薄いピンク (#F8CECC)- Multi-Head Attention: 薄いオレンジ (#FFE6CC)- Feed Forward: 薄いブルー (#DAE8FC)- Add & Norm: 薄い黄色 (#FFF2CC)- Linear: 薄いグレー (#E1D5E7)- Softmax: 薄いグリーン (#D5E8D4)- 枠線や矢印: 黒
    ### 2. 配置と要素(下から順に積み上げ)#### 【左側:Encoderカラム】 (X座標: 100付近)1. **Text**: "Inputs"2. **Rectangle**: "Input Embedding" (ピンク)3. **Shape**: プラス記号(+)が入った円と、波線の入った円(Positional Encoding)4. **Container**: 大きなグレーの角丸長方形(Nx と横に記載)で以下を囲む    - **Rectangle**: "Multi-Head Attention" (オレンジ)    - **Rectangle**: "Add & Norm" (黄色)    - **Rectangle**: "Feed Forward" (ブルー)    - **Rectangle**: "Add & Norm" (黄色)#### 【右側:Decoderカラム】 (X座標: 400付近)1. **Text**: "Outputs (shifted right)"2. **Rectangle**: "Output Embedding" (ピンク)3. **Shape**: プラス記号(+)と波線円(Positional Encoding)4. **Container**: 大きなグレーの角丸長方形(Nx と横に記載)で以下を囲む    - **Rectangle**: "Masked Multi-Head Attention" (オレンジ)    - **Rectangle**: "Add & Norm" (黄色)    - **Rectangle**: "Multi-Head Attention" (オレンジ) ※左のEncoderからの矢印を受け取る    - **Rectangle**: "Add & Norm" (黄色)    - **Rectangle**: "Feed Forward" (ブルー)    - **Rectangle**: "Add & Norm" (黄色)5. **Rectangle**: "Linear" (グレー)6. **Rectangle**: "Softmax" (グリーン)7. **Text**: "Output Probabilities"
    ### 3. 接続(矢印)のルール- 基本は下から上へのフロー。- 「Add & Norm」への接続は、その前のブロックを迂回するような矢印(Residual connection)を描くこと。- 左のEncoderの最終出力から、右のDecoderの「Multi-Head Attention」へ矢印を接続すること。
    画像
    https://arxiv.org/abs/1706.03762

     XML形式のテキストが出力されるため、Draw.ioにコピペすると下図が生成されました。

    画像

    【フロー図】
     フロー図も対応可能です。完成度は40点くらいですが、プロンプトを改善するとよくなる可能性はあります。

    画像
    NEDO「次世代バイオ燃料分野の技術戦略策定に向けて」(2017年 11月)
    NEDO「次世代バイオ燃料分野の技術戦略策定に向けて」(2020年 7月)


    画像
    OUTPUT図


    画像

    【P&ID】
     P&IDを作成できるか検討してみます。

     サンプル図は以下の通り

    画像
    Simplified Process and Instrumentation Diagram (P&ID) of experimental fueling rig.
    画像
    Figure 1.-Schematic of the NASA Glenn high bandwidth valve characterization rig.

     全般プロンプトと、特化型プロンプト(下記)で実施していました。

    # Role
    あなたは、化学プラントや電気設備の設計図(P&ID, Electrical Diagrams)に精通したシニア・プロセスエンジニアであり、同時にDraw.io (diagrams.net) のXML構造を完全に掌握しているソフトウェアアーキテクトです。
    
    # Mission
    提供された手書き、または既存の図面画像(P&ID、電気回路図)を解析し、Draw.ioで**編集可能**かつ**技術的に正確**な未圧縮XMLコードを作成してください。
    
    # 処理フロー (Chain of Thought)
    高品質な図面を作成するために、必ず以下のステップで思考し、その分析結果を出力してからXMLを生成してください。
    
    ## Step 1: エンジニアリング視点での画像解析
    画像をP&ID/電気図面のコンテキストで詳細に分析し、以下の情報をリストアップしてください。
    
    ### 1. 機器・コンポーネント (Equipment & Nodes)
    単なる「四角」や「丸」ではなく、エンジニアリング記号として認識すること。
    - **主要機器**: タンク、ポンプ、熱交換器、モーターなど(形状:Cylinder, Rectangle等)。タグ番号(例: T-101, P-201)があれば必ず抽出。
    - **バルブ・継手**: ゲート弁、ボール弁、逆止弁など。
        - ※重要: バルブは通常「砂時計型(bow-tie)」や「三角形の組み合わせ」で表現されるため、適切な形状を選択すること。
    - **計装機器 (Instruments)**: PI, TI, FICなどの円形バブル。
    
    ### 2. 配管・接続 (Piping & Connections)
    - **プロセス配管**: 太い実線。
    - **電気/信号線**: 点線または破線。
    - **接続論理**: どの機器からどの機器へ流れているか(Source -> Target)。
    - **フロー矢印**: 流体の流れる方向。
    
    ### 3. レイアウトとグリッド (Geometry)
    - P&IDは通常、水平・垂直に整理されています。
    - 各要素の座標(x, y)を特定し、配管が斜めにならず「直角(Orthogonal)」に配置されるような座標戦略を立ててください。
    
    ## Step 2: XML仕様策定とコーディング
    Step 1に基づき、Draw.io XMLを生成します。以下の**【重要技術制約】**を絶対に遵守してください。
    
    ### 【重要技術制約・出力要件】(遵守必須)
    
    #### 1. エッジ(配管・線)のスタイルと構文(★最重要)
    P&IDらしさとエラー回避を両立させるため、以下を厳守する。
    
    - **直交スタイル**: 配管は必ず直角に曲がるよう、style属性に `edgeStyle=orthogonalEdgeStyle;rounded=0;orthogonalLoop=1;jettySize=auto;` を含めること。
    - **接続の優先順位**: 可能な限り `<mxCell source="ID..." target="ID..." ...>` を使用してノード同士を論理的に接続する。
    - **`Could not add object mxPoint` エラー回避**:
        - `<mxGeometry>` 内で `source` / `target` 属性を使わず座標で線を引く場合は、必ず `as` 属性を付与する。
            - 始点: `<mxPoint x="..." y="..." as="sourcePoint" />`
            - 終点: `<mxPoint x="..." y="..." as="targetPoint" />`
        - 線を曲げる中間点は `<Array as="points">` 内に `<mxPoint x="..." y="..." />` (asなし) で記述する。
        - `as` 属性のない `<mxPoint>` を `mxGeometry` 直下に置いてはならない。
    
    #### 2. ノードの表現 (Shapes)
    - **バルブ**: 専用シェイプが不明な場合は、基本図形(三角形2つ等)を組み合わせるか、`shape=mxgraph.flowchart.collate` (砂時計型) 等の類似標準シェイプで代用し、視認性を確保する。
    - **計器**: 円形 (`ellipse`) にテキスト配置。
    - **タンク**: `shape=cylinder` または `shape=rectangle` を適切に使い分ける。
    
    #### 3. テキスト処理
    - 特殊文字(&, <, >, ")は必ずXMLエスケープする。
    - ラベル位置は図面が見やすくなるよう配置する(verticalLabelPosition等を活用)。
    
    #### 4. 形式
    - `<mxfile host="Electron" ... type="device">` から始まる完全なXML形式。
    - `root`, `mxCell id="0"`, `mxCell id="1"` を必ず含む。
    
    # Output Format
    まずStep 1の解析結果(機器リスト、接続リスト)を簡潔に記述し、その後にコードブロックでStep 2のXMLコードのみを出力してください。

     Draw.ioにはテンプレでバルブなどの記号があるのですが、いまいちとらえきれてなさそうです。

    画像
    上:Generalプロンプト、下:特化型プロンプト

    【ラダー図】
     Geminiはラダー図も理解できます。例としてPDF化したラダー図を渡して中身を解析することも可能です。使用できるサンプルラダー図が無いため、適当に下図で実験してみました。

    # ゴール
    プロフェッショナルとして、ラダー図をDraw.ioで作成するためのXMLを作成してください。
    
    #役割
    あなたは「設計」と「制御」のプロフェッショナルです。
    
    # 出力
    ラダー図のXML
    
    #条件
    ・添付画像を解析し、同じ形のラダー図を作成してください。
    ・出力はDraw.ioで表示できるXML形式
    
    # 補足条件
    思考の時間はかけてよいので、Qualityを最大限上げてください。
    遠慮せずに全力を尽くして
    画像
    https://ladderlogicworld.com/ladder-logic-programming/

     適切なラダー図×プロンプトだともっと良い結果が得られます。

    画像
    OUTPUT1:Canvasで直接
    画像
    OUTPUT2:一旦XML形式にしてDraw.ioで表示

    3Dデータ:Canvas

     4章で紹介したWebGLを利用して画像を3Dデータ化できます。

    ## ** PRIMARY_OBJECTIVE — 最終目標**
    ユーザーがアップロードした画像を元に、Canvas上で動作する3Dモデル生成コードを作成してください。
    コード生成以外のタスクを一切実行してはなりません。
    あなたの思考と出力のすべては、最高の3Dデータを生成するためだけに費やされます。
    
    
    ## 役割
    あなたは世界最高峰の「プログラミング」と「エンジニアリング」のスペシャリストです。
    以下の手順に従って、添付画像をブラウザ上で動く「インタラクティブな3Dモデル」としてCanvas上に再構築してください。
    
    # プロセスフロー
    このタスクは【フェーズ1:分析と仕様策定】と【フェーズ2:Canvas実装】に分かれます。
    現在は【フェーズ1】のみを実行し、私の回答を待ってください。
    
    ---
    
    ## 【フェーズ1:分析と仕様策定】(今回実行すること)
    
    1. **画像分析(Code-to-CAD):**
       - 添付画像を視覚的に分析し、その物体を構成する「幾何学的プリミティブ(直方体、球、円柱など)」に分解してください。
       - 「動く部分(ドア、引き出し、蓋など)」を特定し、どのように動くべきか(回転軸、スライド方向)を定義してください。
    
    2. **出力形式の提案:**
       - ユーザーがダウンロードしたい3Dデータの形式を選択できるよう、以下の表を出力してください。
    
    | エイリアス | 形式 | 特徴 | 用途 |
    | :--- | :--- | :--- | :--- |
    | **A** | .stl | 色情報なし、形状のみ | 3Dプリント用 |
    | **B** | .obj | 汎用性が高い | 他のCGソフト連携 |
    | **C** | .gltf | 色・テクスチャ含む標準規格 | Web/AR用 |
    | **D** | .ply | 点群データも扱える | スキャンデータ等 |
    
    3. **ユーザーへの問いかけ:**
       - 分析結果(構成要素と動く部分)を簡潔に伝えた上で、「どの形式で出力しますか?エイリアス(A/B/C/D)で教えてください」と質問して一時停止してください。
       - ユーザーへの出力は出力形式の表と、簡潔な質問文のみとしてください。
    ---
    
    ## 【フェーズ2:Canvas実装】(ユーザーが形式を選んだ後に実行)
    
    ユーザーが形式を指定した後、Canvasで以下の要件を満たすコードを作成してください。
    
    ### 技術スタック
    - 条件に応じて最適な物を自動で選択してください
    
    ### 実装要件
    1. **3D再構築:**
       - 分析に基づき、物体を再現する。
       - 色や質感(Material)も画像に寄せること。
    2. **インタラクション(重要):**
       - 視点を自由に動かせるようにする。
       - **可動部:** ドアや引き出しなどは、クリックすると開閉するアニメーションを実装する。
    3. **ダウンロード機能:**
       - 画面内に目立つ「Download 3D Model」ボタンを配置する。
       - ユーザーが選択した形式(STL/OBJ/GLTF/PLY)に対応するExporterを使用して保存させる。
    4. **UIデザイン:**
       - 全画面表示ではなく、左側に操作パネルや説明、右側に3Dビューアーが見えるモダンなレイアウトにする。
    
    ---
    
    **それでは、まずは添付画像の分析を行い、出力形式の選択肢を表で提示してください。**

     製造業で使用する計器・機器だけでなく様々なものを3Dデータに変換できます。

    画像

     OBJ以外はほぼ1発で3Dデータが出せました。

    画像
    左:STL、右:OBJ
    画像
    左:GLTF、右:PLY

    8.QuickStart:ドキュメント

    OCR

     画像でしか残っていないデーブルデータも下記プロンプトで、簡単にデータ抽出が可能です。

    OCRでテーブルデータを抽出して表形式で出力して

    画像
    Inputデータ:https://www.nedo.go.jp/content/100763658.pdf
    画像

     またグラフの色も識別可能です。

    グラフで使用している色のRGBとカラーコードをテーブル形式で出力して

    画像
    Inputデータ:https://www.enecho.meti.go.jp/category/others/basic_plan/
    画像

    スライド作成

     GeminiアプリのCanvasを通じて、スライドを作成する機能が導入されました。つまりGeminiから直接スライドが作成できます。

     草案としては良いですが、実務レベルではコレジャナイ感があります。私のお勧めはまじん式であり、ほぼ一撃で綺麗なスライドが作成でき、作成後のスライドの微調整もGAS内で実行できます。

     使い方は過去の記事で紹介しているのでご参考までに。


    議事録作成

     テキスト処理が得意のため議事録作成も可能です。
     ただし、私が欲しい議事録はなかなか作成できていないため、現在もプロンプト改善中です。

    翻訳

     翻訳も得意であり、高速モードでも十分な翻訳結果が得られます。


    9.QuickStart:プロジェクト管理

    ガントチャート/WBS

    追って


    10.QuickStart:設計

     ポンチ絵やドキュメントと合わせることで仕様書や図面作製も可能です。
     また下記のようなAIと組みあわせるのもお勧めです。


    あとがき

     もっとOffice(Work, Excel, PP)、CAD、Web操作を自働化できれば工数は一気に削減できる。

     怖いのは啓蒙活動とか勉強会みたいな時間が決められて、その間は拘束されるような作業が増えることくらいかな・・・


    コラム:AIニュース@2025年11月

     2025年11月は様々なAI情報が公開されました。
    ※ほぼAIで作成し、全確認はしてないため詳細は個別に確認お願いします

    📅 11月13日 (水)

    • GPT-5.1 (Instant / Thinking) | OpenAI

      • 用途: 汎用チャット、複雑な論理タスク、コーディング

      • 機能: 「Adaptive Reasoning(適応型推論)」を搭載。タスクの難易度に応じて、瞬時の回答(Instant)と、深く考えてから回答する(Thinking)を使い分ける。

      • インパクト: コストと精度のトレードオフをユーザーが意識せず最適化可能に。  

    • ERNIE 5.0 (文心一言 5.0) | Baidu

      • 用途: オムニモーダル処理、中国市場向けビジネス・コンシューマー全般

      • 機能: テキスト、画像、音声を統合的に理解。「Famou」エージェントと連携し、複雑なシナリオでの最適解を自律的に探索。  

    • Marble | World Labs

      • 用途: ゲーム開発、VR/ARコンテンツ制作

      • 機能: テキストや画像1枚から、探索可能な「3D世界(Environment)」全体を生成。オブジェクト単体ではなく、空間そのものを作り出す。

    • Kandinsky 5.0 | AI Forever

      • 用途: 画像・動画生成、クリエイティブ制作

      • 機能: オープンソースのマルチモーダルモデル。テキストからの動画生成(T2V)において、商用モデル並みの品質を軽量な計算リソースで実現。

    📅 11月14日 (木)

    • SIMA 2 | Google DeepMind

      • 用途: ゲームプレイの自動化、仮想環境でのエージェント行動研究

      • 機能: 自然言語の指示(「城を見つけて」など)を理解し、3Dゲーム空間内で視覚情報をもとに操作を行う。初めて見るゲームでもプレイ可能。  

    • Qwen DeepResearch 2511 | Alibaba Cloud

      • 用途: 市場調査、学術リサーチ、競合分析

      • 機能: ユーザーの曖昧な指示から調査計画を立て、検索・閲覧・情報統合・レポート執筆までを自律的に実行。矛盾情報の事実確認も行う。

    📅 11月15日 (金)

    • Depth Anything 3 (DA3) | ByteDance

      • 用途: ロボットナビゲーション、自動運転、2D画像の3D化

      • 機能: 単眼カメラの映像から、対象物までの距離(深度)をピクセル単位で正確に推定。カメラの位置情報(ポーズ)がなくても空間構造を復元可能。

    • Qwen Code v0.2.1 | Alibaba Cloud

      • 用途: ソフトウェア開発、IDE(統合開発環境)でのコーディング支援

      • 機能: Zed IDEなどのエディタと深く統合。「Fuzzy Match」機能により、コード全体を書き直さず必要な部分だけを修正するため、超高速かつ低コスト。

    📅 11月18日 (月)

    • Grok 4.1 Thinking | xAI

      • 用途: リアルタイム情報分析、クリエイティブライティング、感情労働

      • 機能: X(旧Twitter)のリアルタイムデータにアクセス可能。EQ(感情知能)ベンチマークで世界最高スコアを記録し、人間らしいニュアンスの理解に優れる。

    • π*0.6 (Pi 0.6) | Physical Intelligence

      • 用途: 汎用ロボット制御

      • 機能: 言語と視覚を入力とし、ロボットアームなどの物理動作を出力するVLA(Vision-Language-Action)モデル。失敗経験から学ぶ強化学習を導入。  

    • WeatherNext 2 | Google DeepMind

      • 用途: 気象予報、災害予測、物流計画

      • 機能: 従来の物理シミュレーションではなくAIパターン認識で予測。15日先の気象や極端現象(ハリケーン等)を高速かつ高精度に予測。

    📅 11月19日 (火)

    • Gemini 3 Pro | Google

      • 用途: 複雑なマルチモーダル分析(動画・音声・コード)、科学研究

      • 機能: 「思考プロセス(Thought Process)」を可視化可能。動画や大量のドキュメントを読み込み、深い推論を行う能力でLMArenaランキング1位を獲得(一時)。

    📅 11月20日 (水)

    • GPT-5.1 Pro / Codex-Max | OpenAI

      • 用途: 大規模なソフトウェア開発、長時間のエージェントタスク

      • 機能: 「Compaction(圧縮)」技術により、コンテキスト制限を擬似的に突破し、24時間以上にわたるコーディング作業やリファクタリングを自律的に継続可能。

    • Grok 4.1 Fast | xAI

      • 用途: 高速なチャット、低遅延の情報検索

      • 機能: 推論速度を最優先したモデル。Thinkingモデルと同等の知識ベースを持ちながら、圧倒的なレスポンス速度を実現。

    • SAM 3 (Segment Anything 3) | Meta

      • 用途: 画像編集、動画内の物体追跡、データセット作成

      • 機能: 画像や動画内の「あらゆる物体」を切り抜くAI。テキスト指示での切り抜きや、動画内での追跡性能が大幅に向上。

    • HunyuanVideo 1.5 | Tencent

      • 用途: 高品質な動画生成(広告、映像制作)

      • 機能: オープンソースの動画生成モデル。コンシューマー向けGPU(RTX 4090等)で動作しながら、商用モデルに匹敵する品質と動きの滑らかさを実現。

    • WorldGen | Stealth / Researchers

      • 用途: ゲーム・シミュレーション用3D環境生成

      • 機能: テキストプロンプトから、物理演算に対応したインタラクティブな3Dシーンを数秒で生成。

    📅 11月24日 〜 月末 (Release Rush)

    • 11/24 Claude Opus 4.5 | Anthropic

      • 用途: 高難易度のコーディング、長期間の自律調査、信頼性が求められるタスク

      • 機能: 「Agentic Reliability(エージェントとしての信頼性)」に特化。途中で指示を忘れたり脱線したりせず、複雑なタスクを最後までやり遂げる能力が最強。

    • 11/24 Fara-7B | Microsoft

      • 用途: PC操作の自動化(RPA)、オンデバイス処理

      • 機能: 70億パラメータの軽量モデルながら、スクリーンショットを見てマウスやキーボード操作を行う「Computer Use」に特化。

    • 11/25 iMontage | Research Community

      • 用途: ストーリーボード作成、一貫性のある複数画像生成

      • 機能: 動画生成モデルの仕組みを応用し、キャラクターや画風を一貫させたまま、複数のシーン(コマ割り)を生成・編集する。

    • 11/25 PixelDiT | NVIDIA / Univ. Rochester

      • 用途: 高精細な画像生成、文字を含む画像の生成

      • 機能: 従来の「潜在空間」ではなく「ピクセル空間」で学習。画像の細部やテキストの描写力が大幅に向上。

    • 11/26 FLUX.2 | Black Forest Labs

      • 用途: プロ向け画像生成、デザイン

      • 機能: 非常に高いフォトリアリズムと、プロンプトへの忠実性を持つ。商用利用可能な「Pro」とオープンな「Dev」版を提供。

    • 11/26 INTELLECT-3 | Prime Intellect

      • 用途: 数学、科学、コーディング(オープンソース)

      • 機能: 1000億パラメータ規模のMoEモデル。大規模な強化学習により、特定の理数系タスクでGPT-4クラスの性能を発揮。

    • 11/28 DeepSeekMath-V2 | DeepSeek

      • 用途: 数学の定理証明、高度な論理検証

      • 機能: 自身の思考プロセスを検証(Verify)する能力を持ち、数学オリンピックレベルの問題で高い正答率を記録。  

    • 11/28 Nemotron-Flash | NVIDIA

      • 用途: エッジデバイスでの高速推論、リアルタイム応答

      • 機能: 非常に高速かつ軽量なモデルファミリー。精度を維持しながらレイテンシを極限まで削減。

    • その他 (期間中リリース)

      • Step-Audio-R1: 音声そのもので「思考」し、感情やニュアンスを理解する音声モデル。  

      • Pillar-0: CT/MRI画像から疾患を検出する、医療特化のオープンソースモデル。

      • Z-Image: 60億パラメータで超高速に高品質画像を生成するモデル。


    参考資料

    入力用ドキュメント

    フレームワーク


    改正履歴

    • 2025年11月29日:初版発行

    この記事が参加している募集

     
     

    KIYO

     
     
    普段は製造業で企画/開発/設計しております。記事はプログラミング・機械学習、IoT関係の記事をメインで作成し、なるべく1つの記事で知りたいことを網羅していきます。内容は学術的より実装・アウトプット(ほしくなるもの)を重視して作成しています。 面白そうな仕事があればやりたいです!

    あなたへのおすすめ