見出し画像

Claude Opus 5.5に工事書類を読ませた——海外が「製品」で売る4業務、汎用モデルで再現できるか検証し


海外では今年、提出物レビューや日報作成を専用AIエージェントとして売る製品が出そろった。

日本の現場にはまだそうした専用品がほとんどない。では、誰でも使えるClaude Opus 5.5で、同じ業務はどこまでこなせるのか。正解を仕込んだ架空の工事書類を使って、4業務を数えて評価した。


やったこと

「AIを試してみた」という記事の多くは印象で終わる。今回は数えた。

架空の施工計画書・図面注記・走り書きメモ・特約条項を自作し、食い違いや不利条項をあらかじめ仕込んだ。正解表を別に保管し、AIが何件見つけ、何を作り出したかを採点した。業務ごとに2回ずつ実行し、確認にかかった時間も測った。


結果の要点

業務結果提出物レビュー(計画書×仕様書)5件すべて検出、誤検出ゼロ、確認6分RFI(図面の食い違い検出・質疑書作成)3件検出、単位違いの誤検出が1回、確認8分日報(走り書きメモ→日報・申し送り)数字を作らなかった。ヒヤリハットが薄まった契約レビュー(不利条項の特定)3件検出、存在しない条番号を1件書いた

差が出たのは「見つける力」ではなく「根拠の示し方」だった。

根拠を素材から直接引用させると確認が速い。条番号や固有名詞を書かせると、番号そのものを照合する手間が加わって確認時間が延びた。

日報の「ヒヤリハットが一般論に丸められる」変化は、正解表では気づきにくい。数値のでっち上げより、こちらのほうが現場では危ない。


専用製品と汎用モデルの本質的な差

モデルの判断力はほぼ横並びになりつつある。差は周辺の仕組みにある。

  • 文書の取り込み:専用製品は文書管理と連携して最新版を自動参照。汎用モデルは人が選んで貼る

  • 権限:専用製品は閲覧権限をそのまま引き継ぐ。汎用モデルは貼ってよい情報かを人が判断する

  • 記録:専用製品は誰が何を確認したか履歴が残る。汎用モデルはチャット履歴のみ

この3層を手順で補えば、専用製品を待たずに始められる範囲は広い。


自社で同じ検証をするには

自社の様式で架空書類を作り、誤りを数件仕込んで正解表を保管する。あとはモデルに照合させ、検出数・誤検出・でっち上げ・確認時間を数えるだけ。導入の判断を印象ではなく数字で下せる。


あわせて使えるツール

現場の書類負担を「数字で測る」ことから始めるなら、無料のブラウザツールを用意しています。



詳細な検証内容と図解はこちら

https://kibanjapan.com/writing/claude-opus-5-5-doboku-kenchiku/

いいなと思ったら応援しよう!