メインコンテンツへスキップ
見出し画像

18GBのMacで77GBのQwen3.8-Flash-Nextを動かす

    he-be

    Qwen3.8-Flash-Nextは177Bの最新アーキテクチャのLLMモデルだ。
    ローカルLLM向けに今最もおすすめであり、これまで複数回、NVIDIA向けの高速化について扱ってきた。
    今回はMacで動かす話だ。


    64GB Mac用の量子化を無理やり18GBのMacで動かす

    64GBのMac向けに、「小さい方」のQ2量子化モデルが配布されている。
    「小さい方」でも本体とPLEの表を合わせて77GBある。
    しかも、64GBに本当に載るかは確かめていないと断り書きが付いている。

    それを18GBのMacBook Proで動かした。メモリの4倍を超える。
    17GBのGemma-4、23GBのOrnithと来て、今回は77GBだ。

    流石に無謀だと思われた。


    長いので先に結論

    77GBのQwen3.8-Flash-Nextが、18GBのM3 Pro MacBook Proで動いた。
    数学問題の生成でMTP込み10 t/s。
    最大コンテキストは32k。長い入力でも、スワップせずに動かせた。

    PLEの表32GBはRAMに載せず、SSDに置いたまま引いている。プロセスが自分で持つメモリは1.8GB。

    プレフィルは90 t/s前後。
    遅いが、M5より前のMacでは、ここがハードの限界になるようだ。
    9月22日に届くM6のMac mini 16GB/256GBで確かめたい。


    Geminiにブチギレて作っている

    Tsugumiは、Geminiにブチギレて作り始めたMac用のローカルAIアプリだ。

    Geminiは急にカスになり使えなくなってしまった。名前も値段もそのままで、中身だけが勝手に入れ替わる。昨日まで検索してくれていたのに、今日は「私に検索機能はありません」と平然と断ってくる。
    気に入らなくても前には戻せない。使う側には選ぶ権利がない。そんなものに毎日の調べ物を預けていられない。

    だから全部手元で持つことにした。中身はGemma-4 26Bで、毎日使っている。いまのGemini Flashより、よっぽどまともに仕事をする。

    Gemma-4の答えは中央値になる

    それでも、知能の低さを感じる場面はある。

    Gemma-4に調べ物を頼むと、WEBやローカルのWikipediaをちゃんと検索して、ちゃんと読む。読んだ内容から外れないし、頼んだ形も守る。仕事はできる。

    弱いのは、読む前と読んだ後だ。
    質問をどう受け取るか。検索結果のどれを開くか。読んだ中のどの一行を本題と見るか。ここは、モデルが元から持っている知識で即答しなければならないので、賢さで大きな差が出る。

    Gemma-4は質問を字面どおりに受け取り、目についた記事を開き、読んだものを並べ替えて返してくる。

    そうして出てくるのが、中央値の答えだ。誰にでも当てはまる、一般的で、毒にも薬にもならないアドバイス。無料のChatGPTと話している感覚になる。

    全部手元で完結して、勝手に中身が変わらない。それだけで意義はあるし、Geminiより使えるから使い続けている。

    ただ、もっと知識の多いモデルを載せてみたい。

    Macで前に動かしたOrnithは35Bで、Gemmaの26Bより少し大きい。ただコーディング特化で、調べ物の相手には向かなかった。


    VRAM16GBでも36 t/s出る

    ゲーミングPCのRTX 5080はVRAM16GBしかない。ローカルAIをやるには確実に足りない量だ。それでも、Qwen3.8-Flash-NextのQ4_K_XL、111GBのモデルが、36 t/s(短い文脈・thinking無効・MTP込み)出ている。

    GPUの値段が暴騰している。RAMも高くなったが、VRAMの単価に比べればまだ安い。このモデルは、その安い方に知識を置く作りになっている。
    177B分の知識を、手の届く機材に収めている。

    ただしPCはRAMが128GBある。18GBのMacとはわけが違う。

    それでも手を出したくなる理由が、PLEだった。PLEは知識の表で、1トークンで引くのは16行、数KBしかない。しかも、どの行を引くかは計算を始める前に分かる。エキスパートのように、層ごとに計算してみないと分からない部品とは違う。

    だからPLEはRAMに載せず、SSDに置いたままでよく、読み込み時間を計算に隠すことができる。

    つまり77GBのうち32GBはメモリに載せる必要がなくなる。

    77GBだと流石に無理っぽいが、残り45GBだけだったら、Gemma-4やOrnithでやってきた、使う分だけSSDから読むやり方で回せるかもしれない。

    無謀なチャレンジに希望が見えてきた。

    RAMに置くのは毎回読む分だけ

    配布元のQ2は、expertを2bitまで落としてある。以前の記事で、177BのこのモデルはIQ3_XXS(2.5bit)まで落としても実タスクで差が出なかった。今回はそこからさらに1段量子化を攻めている。

    画像
    流石に他のアプリに返せる余地はほとんどないが、動くことは動く

    プロセスが自分で確保するRAMは1.8GBで、会話の記憶と作業領域だけだ。毎トークン全部読む部分は、読み続けるのでメモリに居続ける。

    expertは、1トークンで選んだ分のうちキャッシュに無いものだけをSSDから読む。どのexpertをメモリに残すかはmacOSに任せていて、空いていれば使い、他のアプリが使えば返す。
    Gemma-4で、自前のキャッシュをやめてOSに丸投げしたのと同じ形だ。

    PLEの表32GBは、RAMに載せずSSDに置いておく。

    ついでに、ウェイトもダイエットした。出力は同じで、77GBは74GBになった。タイトルがすでに訂正が要る。


    MBPで出せる速度

    5 t/sで上等だと思っていた

    18GBのMBPで動いたとしても、5 t/sも出れば上等だろうと思っていた。最初に動いたときは1トークン1秒だった。

    測っては直す作業をClaude Codeに丸投げしていたら、意外と10くらい狙えそうになってきた。数学問題ではMTP込みで10 t/s出ている。長文脈になると遅くなってきて7~8t/sまで落ちる。

    昨日から24時間、MBPに扇風機を当てて空冷し、その前に布団を敷いて、Claude Codeを回しっぱなしにしている。

    26BのGemma-4では40t/s、35BのOrnithでは20t/s 程度の速度で生成できる。パラメータ数(=賢さ)からいうと、177BのQwen3.8-Flash-NextはGemmaの7倍近くあるが、速度低下は4倍くらいで済んでいる。
    これはシンプルにPLEをSSDに置いたまま使える最新アーキテクチャが効果を発揮している。

    プレフィル90 t/sが限界

    生成より困るのが、入力を読む速さだ。90 t/s前後で、GPUの計算が大半だ。
    M5チップからこの計算専用のハードウェアが追加されたので高速化が見込めるが、前世代のMacでは、ここがハードの限界になる。

    それでも、1万2千トークンの入力をスワップせずに回せた。生成は7 t/s台。

    メモリがギリギリだがKVの量子化も合わせてGemmaデフォルトと同じ32kのコンテキストを確保した。質問回答のエージェント動作には十分な長さだ。


    で、Gemmaより使えるのか

    今日、同じ質問を両方に投げた。

    お題1「えきねっとに関する愚痴」

    えきねっと、e5489、ex予約など、鉄道のWEBは利用者を苦しめるのが要件に入ってるのか?

    京都から宇都宮に出張して東京駅の乗り換えが分からなかった

    本当に要件に入っているとは思っていない。ただの愚痴だ。欲しいのは「じゃあ何が要件だったから、こうなったのか」だ。

    Gemmaの答え

    「利用者を苦しめるのが要件」というような事実はありませんが、多くの利用者が「使いにくい」「複雑で分かりにくい」という不満を感じているという側面は、客観的な報道や専門家の指摘からも見て取れます。

    Gemma-4は冗談が通じない

    Gemma-4は文字通り受け取って、まず否定から入る。
    検索結果には2025年のJR4社連携の記事も並んでいたが、Gemmaが開いたのは2018年の東洋経済の記事1本だった。答えはその記事の並べ替えだ。質問に書いたe5489もEX予約も、本文には出てこない。
    まとめは「複雑な料金制度に、各社バラバラのシステム」。間違ってはいないが、誰でも言える。中央値の答えだ。

    Qwen3.8-Flash-Nextの答え

    「利用者苦しめる要件」は入っていませんが、「コスト削減の要件」は入っていて、その副作用として利用者に負荷が乗る設計になっている、というのが実態に近いです。

    Qwen3.8-Flash-Nextは「要件」に乗ってくる

    Qwenは質問の言葉に乗ったまま、愚痴という文脈に好ましい答えを出してくる。

    差が出たのは、何を拾うかだ。最初に読んだダイヤモンドの記事に、みどりの窓口の削減を凍結した話が一行だけ出てくる。Qwenはその一行を本題と見て、窓口削減の凍結で検索し直し、JR東日本の長期戦略の記事まで読みにいった。

    そこから話がつながる。JRのサイトが4社バラバラなのは、国鉄の分割民営化の名残。窓口を減らす前提でネットに移ってもらおうとしたが、ネット側ができあがっていなかった。順序が逆だった。2025年に4社が連携で合意したものの会員登録は各社別のまま残る。

    結論は「窓口の人件費を減らすのが要件で、利用者の負担はその外に置き去りにされていた」。愚痴に対して適切な応答だ。

    ただし、話を盛る癖がある

    Qwenは筋の通った話にするために、少しでっちあげて盛る傾向がある。
    「時間帯による制限は、運用・財務の都合で説明されるものが多い」には出典がない。雰囲気で生成しちゃったようだ。

    Gemmaは読んだものから外れられない。Qwenは知識で筋を組み立て、その筋に合わせて材料を選ぶ。そしてちょっと盛る。


    お題2「書き出し小説大賞」

    もう一つ試した。デイリーポータルZの「書き出し小説大賞」について自分でまとめたメモを渡して、最後に一行足した。

    上記参考に、書き出し小説の具体例を検索して調べ、プレーンテキストで50件列挙して

    プロンプトには丁寧にURLもつけておいた

    メモの中のURLはアプリが先に読み込んで渡すので、どちらのモデルでも実際の投稿作が読めるようになっている。

    Gemma-4は自分で書いてしまう

    頼んだのは、実際の投稿作を探して並べることだ。Gemmaは検索せず、50本を自分で書いた。しかもメモの具体例に引っ張られて、全部が鉱物の話になっている。

    鏡に映ったルビーは、僕とは違う顔をしていた。
    丁寧に箱詰めされた青い石は、かつて僕の妻だった。
    孤独を形にしたものは、光を通さない黒い琥珀だった。

    Gemmaの回答(つまんねー)

    見出しはメモの型の通りに並んでいて、形は守っている。ただ、面白さは0点。「笑いが最優先」とプロンプトに入れたはずなのに、出てくるのはどこかで見たようなポエムだ。

    Qwen3.8-Flash-Nextは探してくる

    Qwenは連載ページの続きと、2025年の秀作まとめを読みにいき、実際の投稿作を投稿者名と回数付きで並べた。

    牛車はゆっくりと俺を轢き、過失の割合は8対2になった。
    サイズを間違えた。3億が入らない。汗を吸った目出し帽は重い。
    20歳の時に助けたタレはしっかり秘伝になっていた。

    これらは本当に入賞作

    最後に、参考に自作するなら「物が主語になって、それ自体が動くのが一番強い」と勘所まで添えてきた。この調べ物が何に使われるかも想定している。Gemmaは同じメモを、書く題材として読んだ。

    待ち時間は7〜10倍

    えきねっとでは、Gemmaが37秒、Qwenが6分。書き出し小説では、Gemmaが1分強、Qwenが8分半。
    プレフィルの遅さもあるが、生成速度の差がやはり効いている。

    ただ、使えない内容をいくら生成しても仕方ないし、現状でも私は許容範囲の待ち時間だと思う。


    9月22日にM6のMac miniで確かめること

    9月22日に、M6のMac mini 16GB/256GBが届く。

    M5からは、GPUに行列計算専用の回路が入った。入力を読む90 t/sの壁が動くなら、この機械で分かる。ただし専用の呼び方をしないと回路を素通りするので、また改修しないと使えない。

    メモリは18GBから2GB減る。32Kでほぼ使い切っていたので、16GBではコンテキスト長か何かを削らないと入らなそうだ。

    それから256GBのSSD。生成の待ち時間はSSDから読むexpertで決まるので、ここが遅いと生成も遅くなる。

    Mac miniが届くのを待ちながら、Tsugumiのバグ修正で今夜もClaude codeが仕事をし続けている。


    おまけ

    開発中のリポジトリはこちら。M6 Mac miniが届いたら一通り検証してリリース予定なので、もうちょっと待って。


     
     
     

    he-be

     
     
    LLMマニア

    あなたへのおすすめ