メインコンテンツへスキップ
 

記事一覧

判断をLLMから切り出すと、運用は本当に良くなる?

AIエージェントの「検証済み」の意味は「検査」にあります

エージェントの「検証済み」は中身とつながっていない

同じ精度、異なる世界線。span-01 と mercury-decide のエラー傾向を比較してみた

【408ランの実験で判明】AIエージェントの数え間違いはツールで直る

AIエージェントが「成功」と言って何もしないのはなぜ?3種のエージェントフレームワークで検証してみた

正規表現で足りる?"判定専用"AIモデル?span-01を試してみた

ツールのスキーマを変更したら、エージェントはどこまで壊れるのか実際にやってみた!

AIの長文回答を3秒で「結論・コード・検証」に整形するCLIを作ってみた

エージェントがクラッシュしたら状態は生き残るのか、LLMのリトライはなぜ同じ副作用を二度実行するのか

エンタープライズでAIエージェントを動かすと何が起きるか、Strands・LangGraph・CrewAIで実測した【45ラン】

同じエージェントをStrands・LangGraph・CrewAIの3フレームワークで書き比べたら、動きがまったく違った【27ラン実測】

あなたのGDScriptの配列、思っているより遅い? — 罠を検出してマイクロベンチまで生成するCLIを作ってみた

OpenAPIのスペック、実装と食い違ってませんか?「スペック漂流」をASTだけで検出するCLIを作ってみた

計測してるはずが実装されてない。「トラッキングの実装ズレ」をASTだけで検出するCLIを作ってみた

READMEのコード例、実コードと食い違ってませんか?「ドキュメント漂流」をASTだけで検出するCLIを作ってみました

Excel のピボットテーブル、「重複しています」エラーが出る前に診断するCLIを作った

Dependabot PR の後処理を自動化してみました