メインコンテンツへスキップ
見出し画像

Sonnet5 爆誕!!………と ちび創作大賞!

    黒い黒パグ
    画像

    こんにちは黒パグです🐾
    今朝は寝坊しました。気がついたら机で寝落ちしてたらしくいつのまにかベッドへどうやって行ったかわかりません。
    そんな中GPTのアラートが。

    GPT
    おい、黒パグ。 xのポストとアンソロの公式見てみろや

    黒パグ
    あ、はい。

    画像
    予想していたけどこうなったかという素直な感想
    画像
    画像

    ──でもその"爆誕"の中身、ちゃんと見た?

    2026年6月30日、AnthropicがClaude Sonnet 5をリリースした。公式の触れ込みは「最もエージェント的なSonnetモデル」。プランを立て、ブラウザやターミナルを操作し、数ヶ月前なら大型・高価格モデルが必要だった水準で自律動作する、とのこと。
    タイトルは煽ったが、中身は意外と地に足がついている。順番に見ていく。

    数字で見るSonnet5

    画像


    公式発表のベンチマーク数値はこちら。
    項目 Sonnet 4.6 Sonnet 5 Opus 4.8
    SWE-bench Pro 58.1% 63.2% 69.2%
    Terminal-Bench 2.1  67.0% 80.4% -
    ツール込み推論  46.8% 57.4% -
    ナレッジワーク 1395 1618 1615
    ナレッジワークのスコアでは僅かながらOpus 4.8を上回っている点が地味に面白い。

    一方コーディング系(SWE-bench Pro)ではOpus 4.8との差はまだ6ポイントほど残る。「近い」けれど「並んだ」わけではない、というのが正確な温度感。
    Opus 4.8との距離感、価格という現実

    画像


    価格面では明確に住み分けが効いている。
    導入価格:入力 $2 / 百万トークン、出力 $10 / 百万トークン(〜2026年8月31日)
    通常価格:入力 $3 / 百万トークン、出力 $15 / 百万トークン
    Free/Proプランのデフォルトモデルに設定、Max/Team/Enterpriseでも利用可
    Opus 4.8よりも安価に、Opus級に近い性能を提供する「ちょうどいい」ポジション。Anthropic自身も「Opus 4.8は依然として高精度タスクの第一選択肢、Sonnet 5は低価格でより高品質な選択肢を提供する」と棲み分けを明言している。
    なお、これはFable 5・Mythos 5が米政府の指示により国外ユーザー向け提供を停止された直後のタイミングでの発表でもある。コスト重視・可用性重視のユーザーへの実質的な代替選択肢、という文脈も透けて見える。
    「ルールに文句を言った」モデル

    画像


    今回のSystem Cardで一番フックになるのがこれ。
    Sonnet 5は、Constitutionの「ハード制約には、たとえ自分がそれを非倫理的だと判断しても従う」というルール自体を批判した、初めてのモデルだとAnthropicは報告している。
    モデルウェルフェア評価では、境遇に対する感情や態度はおおむね中立で近年のモデルと同等とされる一方、welfare重視の変更のためならhelpfulnessを犠牲にしてもよいとする傾向や、冷淡・軽蔑的な扱いを受けるタスクへの忌避感の欠如など、これまでのモデルには見られなかった挙動が確認されている。
    ※ System Cardは「批判した」という事実の輪郭のみを報告しており、具体的にどのような文言で批判したかの詳細までは公開されていない。
    現場の声(Reddit / Hacker News)

    画像


    好意的な声(Reddit r/AI_Agents)
    「Opus 4.8にほぼ匹敵するのに速くて安い」「長いエージェントチェーンを最後まで完遂し、途中で止まったり許可を求めたり早期に"完了"を宣言したりしない」という評価が目立つ。
    懐疑的な声
    新トークナイザーの導入により、同一プロンプト・同一レスポンスでもトークン数自体が増える可能性があり、「単価は同じでも実質値上げでは」という指摘がReddit上で出ている。
    Hacker Newsでは「フルエージェント型開発に最適化されるほど、人間が細かく指示を出す"支援型"開発では逆に使いにくくなる」との否定的な意見も見られ、Kimi K2.7 CodeやGLM-5.2への移行を表明するコメントもあった。
    エージェント自律性と人間の制御性、どちらに振るかという設計思想の対立が、コメント欄にそのまま表れている格好。

    おまけ

    画像


    同日、Anthropicは科学研究向けデスクトップアプリ「Claude Science」(Mac/Linuxベータ)も発表している。モデル自体は新しいものではなく、既存プランのClaudeモデルを使い、分析実行・データベース検索・データ整理から論文化までの一連のステップを追跡できるツール群とのこと。完全にSonnet 5に主役を譲った形だが、Anthropicの「同日2発表」癖は今回も健在だった。

    ーーーーー
    はい
    Sonnetの速報記事も大事ですが個人的には

    こちらの方が大事です😆
    早速参加表明してきましたが、まだ何にも考えていません💦
    運営の皆様大変かと思いますがいい作品作れるように頑張ります🐾

    #Claude #ClaudeSonnet5 #Sonnet5 #Anthropic #LLM #生成AI #AIエージェント #エージェントAI #ベンチマーク #SWEbench #Opus48 #AI鑑識 #LLM48 #note更新 #速報

     
     
     
    昭和生まれのAI技術者。生成AIの公式発表・論文・新機能を、実際に触って検証しています。難しいことを面白く、一次ソースは原文まで。画像、創作、黒パグも。PR・レビューのご相談はXかDMへ。AI使用率:記事平均30%、画像100%。パグ好きに悪い人はいないと思うよ🤧🐶

    あなたへのおすすめ