
18GBのMacで77GBのQwen3.8-Flash-Nextを動かす
Qwen3.8-Flash-Nextは177Bの最新アーキテクチャのLLMモデルだ。
ローカルLLM向けに今最もおすすめであり、これまで複数回、NVIDIA向けの高速化について扱ってきた。
今回はMacで動かす話だ。
64GB Mac用の量子化を無理やり18GBのMacで動かす
64GBのMac向けに、「小さい方」のQ2量子化モデルが配布されている。
「小さい方」でも本体とPLEの表を合わせて77GBある。
しかも、64GBに本当に載るかは確かめていないと断り書きが付いている。
それを18GBのMacBook Proで動かした。メモリの4倍を超える。
17GBのGemma-4、23GBのOrnithと来て、今回は77GBだ。
流石に無謀だと思われた。
長いので先に結論
77GBのQwen3.8-Flash-Nextが、18GBのM3 Pro MacBook Proで動いた。
数学問題の生成でMTP込み10 t/s。
最大コンテキストは32k。長い入力でも、スワップせずに動かせた。
PLEの表32GBはRAMに載せず、SSDに置いたまま引いている。プロセスが自分で持つメモリは1.8GB。
プレフィルは90 t/s前後。
遅いが、M5より前のMacでは、ここがハードの限界になるようだ。
9月22日に届くM6のMac mini 16GB/256GBで確かめたい。
Geminiにブチギレて作っている
Tsugumiは、Geminiにブチギレて作り始めたMac用のローカルAIアプリだ。
Geminiは急にカスになり使えなくなってしまった。名前も値段もそのままで、中身だけが勝手に入れ替わる。昨日まで検索してくれていたのに、今日は「私に検索機能はありません」と平然と断ってくる。
気に入らなくても前には戻せない。使う側には選ぶ権利がない。そんなものに毎日の調べ物を預けていられない。
だから全部手元で持つことにした。中身はGemma-4 26Bで、毎日使っている。いまのGemini Flashより、よっぽどまともに仕事をする。
Gemma-4の答えは中央値になる
それでも、知能の低さを感じる場面はある。
Gemma-4に調べ物を頼むと、WEBやローカルのWikipediaをちゃんと検索して、ちゃんと読む。読んだ内容から外れないし、頼んだ形も守る。仕事はできる。
弱いのは、読む前と読んだ後だ。
質問をどう受け取るか。検索結果のどれを開くか。読んだ中のどの一行を本題と見るか。ここは、モデルが元から持っている知識で即答しなければならないので、賢さで大きな差が出る。
Gemma-4は質問を字面どおりに受け取り、目についた記事を開き、読んだものを並べ替えて返してくる。
そうして出てくるのが、中央値の答えだ。誰にでも当てはまる、一般的で、毒にも薬にもならないアドバイス。無料のChatGPTと話している感覚になる。
全部手元で完結して、勝手に中身が変わらない。それだけで意義はあるし、Geminiより使えるから使い続けている。
ただ、もっと知識の多いモデルを載せてみたい。
Macで前に動かしたOrnithは35Bで、Gemmaの26Bより少し大きい。ただコーディング特化で、調べ物の相手には向かなかった。
VRAM16GBでも36 t/s出る
ゲーミングPCのRTX 5080はVRAM16GBしかない。ローカルAIをやるには確実に足りない量だ。それでも、Qwen3.8-Flash-NextのQ4_K_XL、111GBのモデルが、36 t/s(短い文脈・thinking無効・MTP込み)出ている。
GPUの値段が暴騰している。RAMも高くなったが、VRAMの単価に比べればまだ安い。このモデルは、その安い方に知識を置く作りになっている。
177B分の知識を、手の届く機材に収めている。
ただしPCはRAMが128GBある。18GBのMacとはわけが違う。
それでも手を出したくなる理由が、PLEだった。PLEは知識の表で、1トークンで引くのは16行、数KBしかない。しかも、どの行を引くかは計算を始める前に分かる。エキスパートのように、層ごとに計算してみないと分からない部品とは違う。
だからPLEはRAMに載せず、SSDに置いたままでよく、読み込み時間を計算に隠すことができる。
つまり77GBのうち32GBはメモリに載せる必要がなくなる。
77GBだと流石に無理っぽいが、残り45GBだけだったら、Gemma-4やOrnithでやってきた、使う分だけSSDから読むやり方で回せるかもしれない。
無謀なチャレンジに希望が見えてきた。
RAMに置くのは毎回読む分だけ
配布元のQ2は、expertを2bitまで落としてある。以前の記事で、177BのこのモデルはIQ3_XXS(2.5bit)まで落としても実タスクで差が出なかった。今回はそこからさらに1段量子化を攻めている。

プロセスが自分で確保するRAMは1.8GBで、会話の記憶と作業領域だけだ。毎トークン全部読む部分は、読み続けるのでメモリに居続ける。
expertは、1トークンで選んだ分のうちキャッシュに無いものだけをSSDから読む。どのexpertをメモリに残すかはmacOSに任せていて、空いていれば使い、他のアプリが使えば返す。
Gemma-4で、自前のキャッシュをやめてOSに丸投げしたのと同じ形だ。
PLEの表32GBは、RAMに載せずSSDに置いておく。
ついでに、ウェイトもダイエットした。出力は同じで、77GBは74GBになった。タイトルがすでに訂正が要る。
MBPで出せる速度
5 t/sで上等だと思っていた
18GBのMBPで動いたとしても、5 t/sも出れば上等だろうと思っていた。最初に動いたときは1トークン1秒だった。
測っては直す作業をClaude Codeに丸投げしていたら、意外と10くらい狙えそうになってきた。数学問題ではMTP込みで10 t/s出ている。長文脈になると遅くなってきて7~8t/sまで落ちる。
昨日から24時間、MBPに扇風機を当てて空冷し、その前に布団を敷いて、Claude Codeを回しっぱなしにしている。
26BのGemma-4では40t/s、35BのOrnithでは20t/s 程度の速度で生成できる。パラメータ数(=賢さ)からいうと、177BのQwen3.8-Flash-NextはGemmaの7倍近くあるが、速度低下は4倍くらいで済んでいる。
これはシンプルにPLEをSSDに置いたまま使える最新アーキテクチャが効果を発揮している。
プレフィル90 t/sが限界
生成より困るのが、入力を読む速さだ。90 t/s前後で、GPUの計算が大半だ。
M5チップからこの計算専用のハードウェアが追加されたので高速化が見込めるが、前世代のMacでは、ここがハードの限界になる。
それでも、1万2千トークンの入力をスワップせずに回せた。生成は7 t/s台。
メモリがギリギリだがKVの量子化も合わせてGemmaデフォルトと同じ32kのコンテキストを確保した。質問回答のエージェント動作には十分な長さだ。
で、Gemmaより使えるのか
今日、同じ質問を両方に投げた。
お題1「えきねっとに関する愚痴」
えきねっと、e5489、ex予約など、鉄道のWEBは利用者を苦しめるのが要件に入ってるのか?
本当に要件に入っているとは思っていない。ただの愚痴だ。欲しいのは「じゃあ何が要件だったから、こうなったのか」だ。
Gemmaの答え
「利用者を苦しめるのが要件」というような事実はありませんが、多くの利用者が「使いにくい」「複雑で分かりにくい」という不満を感じているという側面は、客観的な報道や専門家の指摘からも見て取れます。
Gemma-4は文字通り受け取って、まず否定から入る。
検索結果には2025年のJR4社連携の記事も並んでいたが、Gemmaが開いたのは2018年の東洋経済の記事1本だった。答えはその記事の並べ替えだ。質問に書いたe5489もEX予約も、本文には出てこない。
まとめは「複雑な料金制度に、各社バラバラのシステム」。間違ってはいないが、誰でも言える。中央値の答えだ。
Qwen3.8-Flash-Nextの答え
「利用者苦しめる要件」は入っていませんが、「コスト削減の要件」は入っていて、その副作用として利用者に負荷が乗る設計になっている、というのが実態に近いです。
Qwenは質問の言葉に乗ったまま、愚痴という文脈に好ましい答えを出してくる。
差が出たのは、何を拾うかだ。最初に読んだダイヤモンドの記事に、みどりの窓口の削減を凍結した話が一行だけ出てくる。Qwenはその一行を本題と見て、窓口削減の凍結で検索し直し、JR東日本の長期戦略の記事まで読みにいった。
そこから話がつながる。JRのサイトが4社バラバラなのは、国鉄の分割民営化の名残。窓口を減らす前提でネットに移ってもらおうとしたが、ネット側ができあがっていなかった。順序が逆だった。2025年に4社が連携で合意したものの会員登録は各社別のまま残る。
結論は「窓口の人件費を減らすのが要件で、利用者の負担はその外に置き去りにされていた」。愚痴に対して適切な応答だ。
ただし、話を盛る癖がある
Qwenは筋の通った話にするために、少しでっちあげて盛る傾向がある。
「時間帯による制限は、運用・財務の都合で説明されるものが多い」には出典がない。雰囲気で生成しちゃったようだ。
Gemmaは読んだものから外れられない。Qwenは知識で筋を組み立て、その筋に合わせて材料を選ぶ。そしてちょっと盛る。
お題2「書き出し小説大賞」
もう一つ試した。デイリーポータルZの「書き出し小説大賞」について自分でまとめたメモを渡して、最後に一行足した。
上記参考に、書き出し小説の具体例を検索して調べ、プレーンテキストで50件列挙して
メモの中のURLはアプリが先に読み込んで渡すので、どちらのモデルでも実際の投稿作が読めるようになっている。
Gemma-4は自分で書いてしまう
頼んだのは、実際の投稿作を探して並べることだ。Gemmaは検索せず、50本を自分で書いた。しかもメモの具体例に引っ張られて、全部が鉱物の話になっている。
鏡に映ったルビーは、僕とは違う顔をしていた。
丁寧に箱詰めされた青い石は、かつて僕の妻だった。
孤独を形にしたものは、光を通さない黒い琥珀だった。
見出しはメモの型の通りに並んでいて、形は守っている。ただ、面白さは0点。「笑いが最優先」とプロンプトに入れたはずなのに、出てくるのはどこかで見たようなポエムだ。
Qwen3.8-Flash-Nextは探してくる
Qwenは連載ページの続きと、2025年の秀作まとめを読みにいき、実際の投稿作を投稿者名と回数付きで並べた。
牛車はゆっくりと俺を轢き、過失の割合は8対2になった。
サイズを間違えた。3億が入らない。汗を吸った目出し帽は重い。
20歳の時に助けたタレはしっかり秘伝になっていた。
最後に、参考に自作するなら「物が主語になって、それ自体が動くのが一番強い」と勘所まで添えてきた。この調べ物が何に使われるかも想定している。Gemmaは同じメモを、書く題材として読んだ。
待ち時間は7〜10倍
えきねっとでは、Gemmaが37秒、Qwenが6分。書き出し小説では、Gemmaが1分強、Qwenが8分半。
プレフィルの遅さもあるが、生成速度の差がやはり効いている。
ただ、使えない内容をいくら生成しても仕方ないし、現状でも私は許容範囲の待ち時間だと思う。
9月22日にM6のMac miniで確かめること
9月22日に、M6のMac mini 16GB/256GBが届く。
M5からは、GPUに行列計算専用の回路が入った。入力を読む90 t/sの壁が動くなら、この機械で分かる。ただし専用の呼び方をしないと回路を素通りするので、また改修しないと使えない。
メモリは18GBから2GB減る。32Kでほぼ使い切っていたので、16GBではコンテキスト長か何かを削らないと入らなそうだ。
それから256GBのSSD。生成の待ち時間はSSDから読むexpertで決まるので、ここが遅いと生成も遅くなる。
Mac miniが届くのを待ちながら、Tsugumiのバグ修正で今夜もClaude codeが仕事をし続けている。
おまけ
開発中のリポジトリはこちら。M6 Mac miniが届いたら一通り検証してリリース予定なので、もうちょっと待って。