Claude Opus 5.5に工事書類を読ませた——海外が「製品」で売る4業務、汎用モデルで再現できるか検証し
海外では今年、提出物レビューや日報作成を専用AIエージェントとして売る製品が出そろった。
日本の現場にはまだそうした専用品がほとんどない。では、誰でも使えるClaude Opus 5.5で、同じ業務はどこまでこなせるのか。正解を仕込んだ架空の工事書類を使って、4業務を数えて評価した。
やったこと
「AIを試してみた」という記事の多くは印象で終わる。今回は数えた。
架空の施工計画書・図面注記・走り書きメモ・特約条項を自作し、食い違いや不利条項をあらかじめ仕込んだ。正解表を別に保管し、AIが何件見つけ、何を作り出したかを採点した。業務ごとに2回ずつ実行し、確認にかかった時間も測った。
結果の要点
業務結果提出物レビュー(計画書×仕様書)5件すべて検出、誤検出ゼロ、確認6分RFI(図面の食い違い検出・質疑書作成)3件検出、単位違いの誤検出が1回、確認8分日報(走り書きメモ→日報・申し送り)数字を作らなかった。ヒヤリハットが薄まった契約レビュー(不利条項の特定)3件検出、存在しない条番号を1件書いた
差が出たのは「見つける力」ではなく「根拠の示し方」だった。
根拠を素材から直接引用させると確認が速い。条番号や固有名詞を書かせると、番号そのものを照合する手間が加わって確認時間が延びた。
日報の「ヒヤリハットが一般論に丸められる」変化は、正解表では気づきにくい。数値のでっち上げより、こちらのほうが現場では危ない。
専用製品と汎用モデルの本質的な差
モデルの判断力はほぼ横並びになりつつある。差は周辺の仕組みにある。
文書の取り込み:専用製品は文書管理と連携して最新版を自動参照。汎用モデルは人が選んで貼る
権限:専用製品は閲覧権限をそのまま引き継ぐ。汎用モデルは貼ってよい情報かを人が判断する
記録:専用製品は誰が何を確認したか履歴が残る。汎用モデルはチャット履歴のみ
この3層を手順で補えば、専用製品を待たずに始められる範囲は広い。
自社で同じ検証をするには
自社の様式で架空書類を作り、誤りを数件仕込んで正解表を保管する。あとはモデルに照合させ、検出数・誤検出・でっち上げ・確認時間を数えるだけ。導入の判断を印象ではなく数字で下せる。
あわせて使えるツール
現場の書類負担を「数字で測る」ことから始めるなら、無料のブラウザツールを用意しています。
詳細な検証内容と図解はこちら
https://kibanjapan.com/writing/claude-opus-5-5-doboku-kenchiku/
