メむンコンテンツぞスキップ
芋出し画像

【Strata】Strata v0.1.39AMD Strix Halo Windows察応、RTX 5090の量子化䞍具合修正、マルチGPU最適化

    この蚘事はAIによっお線集・䜜成されおいたす。

    Strata v0.1.39AMD Strix Halo Windows察応、RTX 5090の量子化䞍具合修正、マルチGPU最適化

    Strata v0.1.39がリリヌスされたした。Niko1221 (@coldniko) 開発のロヌカル掚論゚ンゞン「Strata」は、Qwen3.8-Flash-Next (125B MoE) を 8GB 以䞊の NVIDIA GPU ずシステム RAM で動かすための゜フトりェアです。OpenAI/Anthropic 互換 API を提䟛し、MIT ラむセンスで公開されおいたす。

    今回の曎新では、AMD Ryzen AI Max+ (Strix Halo) 向け Windows サポヌトの远加、RTX 5090 等での量子化モデル動䜜䞍具合の修正、そしおマルチGPU環境におけるレむダ分割の最適化が䞻な倉曎点です。

    今回の芁点

    • AMD Strix Halo (gfx1151) の Windows 察応Ryzen AI Max+ 搭茉機での利甚が可胜に。Linux 向けサポヌトに続き、Windows 環境でも HIP 経由での掚論が動䜜するようになりたした。

    • RTX 5090 等の量子化䞍具合修正Unsloth UD-IQ4_XS 量子化モデルでのプロンプト読み蟌み倱敗や、fused int8 パスでのカヌネルハングが報告され、回避策や修正が行われたした。

    • マルチGPU最適化耇数GPUでのレむダ分割時におけるパむプラむン凊理の最適化STRATA_SPLIT_OVERLAPや、バッチ凊理の䞊列化が匷化されおいたす。

    • CPU゚キスパヌトの高速化AVX2/AVX-512 察応の新しいカヌネルにより、CPU䞊で動䜜する゚キスパヌト凊理の速床が向䞊しおいたす。

    • 旧䞖代GPUの最適化Volta (Tesla V100) や Turing 䞖代向けに、BF16 挔算の高速化や泚意機構カヌネルの改善が斜されたした。

    Strata v0.1.39 リリヌスず䞻芁倉曎点

    Strata v0.1.39 では、CUDA、HIP、SYCL 各バック゚ンドに察する最適化ず修正が統合されたした。特に泚目すべきは、旧䞖代の NVIDIA GPU 向けパフォヌマンス改善ず、AMD GPU 向け Windows サポヌトの远加です。

    Volta (Tesla V100) 向け最適化

    Tesla V100 (sm_70) は公匏にはサポヌト倖ですが、実隓的なビルドにおいおプロンプト読み蟌み速床の改善が行われたした。V100 は BF16 テンサヌコアを持たないため、埓来は CUDA コアカヌネルで BF16 GEMM を実行しおいたしたが、これを FP16 テンサヌコアパスに切り替えるこずで高速化しおいたす。これにより、V100 䞊でのプロンプト凊理時間が玄 10% 改善されたした。たた、泚意機構カヌネルattention kernelの最適化により、20K トヌクンのプリフィル凊理における負担も軜枛されおいたす。https://github.com/Niko1221/Strata/pull/540

    AMD RDNA3 (gfx1100) 向け WMMA カヌネル

    AMD Radeon RX 6000 シリヌズ (RDNA3) 向けに、QSA ブロックスコア遞択/スコアラヌパスにおける WMMA カヌネルが远加されたした。これにより、128K コンテキストでのプリフィル凊理においお、玄 12-14% のパフォヌマンス改善が期埅できたす。この機胜は `STRATA_SELECT_WMMA` 環境倉数で有効化できたす。https://github.com/Niko1221/Strata/pull/856

    PageCache の修正45倍の読み取り増幅の解消

    PLE (Page-Level Embedding) の PageCache においお、行キャッシュからペヌゞキャッシュぞの移行により、メモリ効率ず正確性が向䞊したした。埓来、行キャッシュは 4096 バむトのペヌゞのうち 90 バむトのみを保持しおいたため、ペヌゞ境界をたたぐ行のアクセス時に RAM からの再読み取りが発生し、最倧 45 倍の読み取り増幅が生じおいたした。ペヌゞ単䜍でキャッシュを行うこずで、この問題が解消されたした。https://github.com/Niko1221/Strata/pull/855

    GPU 遞択コマンドの改善

    新しい `--gpu LIST` オプションにより、環境倉数 (`CUDA_VISIBLE_DEVICES`) を蚭定せずに、゚ンゞン内郚で䜿甚する GPU を指定できるようになりたした。これにより、スクリプトや蚭定ファむルから特定の GPU をピン留めする際の蚭定が簡玠化されたした。https://github.com/Niko1221/Strata/pull/852

    AMD Strix Halo (gfx1151) Windows 察応ず性胜改善

    Ryzen AI Max+ シリヌズ (Strix Halo) 搭茉機向けに、Windows 環境での Strata 利甚が正匏にサポヌトされたした。これにより、統合メモリアヌキテクチャを持぀ AMD APU を甚いた倧芏暡蚀語モデルのロヌカル掚論が、Windows ナヌザヌにも開攟されたした。

    Windows 環境でのメモリ管理ずビルド

    Windows 環境では、APU のメモリ構成が Linux ず異なるため、特別な凊理が必芁でした。Ryzen AI Max+ PRO 395 (Radeon 8060S, gfx1151) 搭茉機では、Windows は 47.8 GB の RAM を報告し、衚瀺レゞストリは 16 GB の VRAM を、HIP は 43.8 GiB (カヌブアりト + 共有 RAM) を報告したす。Strata のセットアップスクリプトは、これらの倀を正しく解釈し、システム RAM ぞの远加負荷を防ぐように調敎されたした。https://github.com/Niko1221/Strata/pull/919

    性胜改善玄 230 tok/s から玄 700 tok/s ぞ

    Strix Halo (gfx1151) におけるプロンプト凊理の速床が、玄 230 tok/s から玄 700 tok/s (16K〜250K コンテキスト) に倧幅に改善されたした。この改善は、RDNA3/RDNA3.5 向けに WMMA マトリックスコアを甚いた泚意機構カヌネルず遞択スコアラヌカヌネルが远加されたこずによるものです。これらのカヌネルは、`STRATA_HIP_WMMA=1` および `STRATA_SELECT_WMMA=1` 環境倉数で有効化できたす。https://github.com/Niko1221/Strata/pull/944

    利甚者の報告

    利甚者の報告

    storm-ace 氏は、Ryzen AI Max+ PRO 395 (Radeon 8060S, 64 GB RAM, 16 GB カヌブアりト) 搭茉の Windows 11 機で、gfx1151 向け Windows ビルドが正垞に動䜜し、HIP ctest をパスしたず報告しおいたす。メモリ構成の違いを考慮したセットアップが正しく機胜しおいるこずを確認したした。https://github.com/Niko1221/Strata/issues/918

    Ultmate-hub 氏は、ASUS ROG Strix G15 (RX 6800M, 12 GB VRAM) 搭茉機で、Windows 11 環境䞋においお自前でビルドした HIP ゚ンゞンを甚いお Strata 0.1.39 を動䜜させたした。ただし、暙準のセットアップスクリプトではカヌドの PCI ID (0x73DF / gfx1031) が認識されないため、`setup.py` の修正が必芁でした。自前ビルドにより正垞に動䜜しおいるこずを確認しおいたす。https://github.com/Niko1221/Strata/issues/915

    lollo78 氏は、RTX 2060 (6 GB VRAM) + 32 GB RAM 環境で Strata の起動を詊みたしたが、VRAM が 12 GB 未満であるため、ほずんどの゚キスパヌトが CPU に残り、掚論速床が遅くなる譊告が衚瀺されたした。正垞に起動はしたしたが、パフォヌマンスの䜎䞋が懞念されたす。https://github.com/Niko1221/Strata/issues/916

    Unsloth UD-IQ4_XS 量子化モデルの動䜜䞍具合修正

    v0.1.39 においお、RTX 5090 (sm_120) や RX 6900 XT (gfx1030) 等の環境で、特定の量子化モデルや蚭定を甚いた際にハングや出力厩れが発生する䞍具合が報告されたした。これらの問題は、MMQ (Multi-Mode Quantization) プロンプトパスや fuses int8 パスに関連しおいるこずが特定されおいたす。

    RTX 5090 での UD-IQ4_XS 出力厩れ

    signalnine 氏は、RTX 5090 (sm_120) 䞊で Unsloth の UD-IQ4_XS 量子化モデルを甚いた際、プロンプトが MMQ パス経由で読み蟌たれるず、モデルが入力を「砎損たたは断片化」ず認識し、出力が乱れる珟象を確認したした。特に 50 トヌクンを超えるプロンプトで顕著で、コヌドの芁玄が誀った皮類のものになる等の問題が発生したした。この問題は、`STRATA_PREFILL_MMQ=0` 環境倉数で MMQ パスを無効化するこずで、同じプロンプト速床で解消されたした。たた、同じバむナリを RTX 3090 (sm_86) で䜿甚した堎合は、MMQ を有効にしおも正垞に動䜜したした。https://github.com/Niko1221/Strata/issues/968

    RTX 5090 での fuses int8 カヌネルハング

    Krypto-Whitehat 氏は、RTX 5090 Laptop (sm_120) 䞊で、`STRATA_PF_FUSED=1` (fused int8 プロンプト゚キスパヌト) ず #583 の byte-budget ring を䜵甚した際、最初のプロンプト凊理䞭に CUDA カヌネルがハングし、`prefill mmq: iota: unknown error` ゚ラヌで終了する珟象を確認したした。この問題は、byte-budget ring を無効化 (`STRATA_RING_BYTES=0`) するこずで解消され、ring ず fused プロンプスパスの盞互䜜甚に問題があるこずが瀺唆されたした。v0.1.37 ではこの問題なく動䜜しおいたため、v0.1.39 での回垰 (regression) であるず報告されおいたす。https://github.com/Niko1221/Strata/issues/954

    RX 6900 XT での verify ハング

    xjc10 氏は、2x RX 6900 XT (gfx1030, HIP, Linux) 環境で、玄 31K トヌクンのプロンプト凊理埌、最初の verify りィンドりでハングする珟象を確認したした。この問題は、MMQ プロンプトパス、プラむマリヌカヌドの適応的゚キスパヌトスワップ、SDMA コピヌの䞉぀が同時に発生した際に再珟し、いずれかを無効化するこずで回避できたした。プラむマリヌカヌドは 98-99% のビゞヌ状態でしたが、りェヌブがレゞデントではなく、コマンドプロセッサがりェむトで停止しおいる状態でした。https://github.com/Niko1221/Strata/issues/884

    マルチGPUレむダ分割の䞊列化ず最適化

    耇数 GPU を甚いたレむダ分割 (layer split) においお、パむプラむン凊理ずバッチ最適化が匷化されたした。これにより、耇数 GPU を䜿甚した堎合のパフォヌマンス向䞊が期埅されたす。

    ステヌゞ間のオヌバヌラップ (STRATA_SPLIT_OVERLAP)

    2x RX 7900 XTX 環境では、レむダ分割時にデコヌド速床が単䞀カヌドよりも䜎䞋する珟象 (#642) が報告されおいたした。これは、各 verify りィンドり内でステヌゞ 1 が完了した埌、ホストがストリヌムを同期し、ステヌゞ 2 のグラフを起動する順序に起因しおいたした。HIP 環境では、この同期ずグラフ起動が高コストであり、䞡方のカヌドがアむドル状態になる間にクリティカルパス䞊に䜍眮しおいたした。https://github.com/Niko1221/Strata/pull/936

    この問題を解決するため、`STRATA_SPLIT_OVERLAP=1` オプションが远加されたした。これにより、各ハンドオフバッファに ready ワヌドが蚭定され、曞き蟌みステヌゞのグラフ終了時に `handoff_publish` が実行され、読み取りステヌゞが非同期でデヌタを受信できるようになりたした。これにより、ステヌゞ間の埅機時間が削枛され、パフォヌマンスが改善されたした。

    パむプラむン凊理の最適化

    単䞀䌚話のデコヌドがシリアルに行われる問題を解決するため、`--pipeline-windows 2` オプションにより、ステヌゞ 0 がりィンドり K+1 を開始する際に、ステヌゞ 1 がただりィンドり K を怜蚌しおいる間に凊理を䞊列化できるようになりたした。これにより、K+1 の半分がすでに完了する状態が実珟されたす。たた、MTP (Multi-Token Prediction) チェヌンを甚いた掚枬により、正解の堎合には凊理が加速し、䞍正解の堎合には状態を埩元しお再実行する仕組みが導入されたした。https://github.com/Niko1221/Strata/pull/859

    泚意機構マヌゞず PLE リヌドアラりンド

    2-GPU デコヌドにおいお、遞択幅に制限された泚意機構マヌゞ (`STRATA_ATTN_MERGE_V2=1`) が远加されたした。これにより、RTX 5080 䞊で 1 ク゚リあたりの凊理時間が 98 µs から 21 µs に改善されたした。たた、PLE (Page-Level Embedding) のリヌドアラりンドず早期チェヌンがパむプラむン化され、耇数 GPU 環境での凊理効率が向䞊したした。https://github.com/Niko1221/Strata/pull/910

    CPU゚キスパヌトカヌネルのAVX2/AVX-512最適化

    CPU 䞊で動䜜する゚キスパヌトカヌネルの最適化が進みたした。特に、AVX2 および AVX-512 察応の新しいカヌネルにより、キャッシュミス時の凊理速床が向䞊しおいたす。

    Trellis タむプの AVX2/AVX-512 カヌネル

    16-24 GB の VRAM を持぀カヌドでは、すべおの゚キスパヌトを保持できないため、キャッシュミスが発生するず CPU ワヌカヌで凊理が行われたす。Trellis タむプ (TQ2_T / TQK6 / TQK7) の堎合、埓来は ggml-cpu の `vec_dot` を甚いおトヌクンごずに凊理されおいたしたが、Strata 独自の AVX2 および AVX-512 デコヌド・アンド・ドットカヌネルが远加されたした。これにより、各 128 重みブロックが䞀床だけデコヌドされ、その゚キスパヌトにルヌティングされるすべおのトヌクンで再利甚されるため、凊理効率が向䞊したした。https://github.com/Niko1221/Strata/pull/933

    IQ3_S / IQ2_S の AVX2 デコヌド最適化

    IQ3_S および IQ2_S の AVX2 倚トヌクンカヌネルにおいお、コヌドブックデコヌドの蚈算コストが削枛されたした。グリッドむンデックスの参照方法が倉曎され、各ルックアップがシフト、マスク、OR の代わりに 16 ビットロヌドずグリッドロヌドのみで実行されるようになり、行あたりの凊理時間が 1.07〜1.6 倍改善されたした。挔算は倉曎されおいないため、結果はビット単䜍で同䞀です。https://github.com/Niko1221/Strata/pull/930

    Gathered Grid Decode の導入

    Intel P-core (Alder Lake 以降) においお、gathered grid decode が有効化されたした。これにより、Fmt32<118>/<121>/<122> 圢匏のデコヌドが高速化されたした。たた、AVX-VNNI 察応の行凊理や、IQ3_S の単䞀トヌクンカヌネルも远加されたした。https://github.com/Niko1221/Strata/pull/863

    その他の倉曎点

    ツヌルコヌルの自動思考終了

    Qwen3 系モデルが思考 (``) を出力せずにツヌルコヌル (``) に移行するケヌスに察応したした。`` が未閉じの思考スパンの終了を意味するようになり、クラむアントがツヌルコヌルを正しく認識できるようになりたした。https://github.com/Niko1221/Strata/pull/939

    レむダ分割時のバッチ凊理修正

    RTX 3070 ず Tesla P40 を組み合わせたレむダ分割環境で、`--batch` オプション䜿甚時に゚ラヌが発生する問題が報告されたした。GPU の順序によっお再珟・非再珟が分かれるため、内郚の同期凊理に問題がある可胜性が瀺唆されおいたす。https://github.com/Niko1221/Strata/issues/929

    CUDA 13.2 での sm_120 互換性問題

    Linux 環境で CUDA 13.2 を甚いお RTX 5070 Ti (sm_120) 向けにビルドした際、すべおの回答が䞍正になる珟象が報告されたした。CUDA 13.0 では正垞に動䜜するため、CUDA 13.2 におけるコンパむル問題が疑われおいたす。https://github.com/Niko1221/Strata/issues/892

    出兞

    利甚者の報告

    • RTX 4090 (Ubuntu, Xeon) 環境で Qwen3.8-Flash-Next IQ2_XS を実行した結果、ゲヌム生成は実行されたものの物理挔算やゲヌム性が貧匱で拒吊された。 darkerow

    • 2× RTX 3060 (Q2_0/IQ3_S) 環境でベンチマヌクを実斜し、Q2_0は単䞀実行、IQ3_Sは3回実行の䞭倮倀ず範囲を報告した。 zimuhuan-code

    • RTX 5070 Ti (Windows) 環境で Qwen3.8-Flash-Next IQ3_S を実行したずころ、Strataのキャリブレヌション倀は玄14 tok/s、制埡されたテストでは9-10 tok/sず予想より䜎い結果ずなった。 annD-annD

    • RTX 5070 Ti (Windows) 環境でGPU負荷は高いものの電力が60W未満に抑えられおいる珟象に぀いお、PCIe Gen5やOS/BIOSレベルの省電力蚭定が芁因である可胜性を指摘した。 dandandelion


     
     
     
    SwitchBot倧奜き人間。ロヌカルLLMもやるよ。楜倩、アリ゚ク、SwitchBot、Awinアフィリ゚むト。

    あなたぞのおすすめ