
ãStrataãStrata v0.1.39ïŒAMD Strix Halo Windows察å¿ãRTX 5090ã®éååäžå ·åä¿®æ£ããã«ãGPUæé©å
ãã®èšäºã¯AIã«ãã£ãŠç·šéã»äœæãããŠããŸãã
Strata v0.1.39ïŒAMD Strix Halo Windows察å¿ãRTX 5090ã®éååäžå ·åä¿®æ£ããã«ãGPUæé©å
Strata v0.1.39ããªãªãŒã¹ãããŸãããNiko1221 (@coldniko) éçºã®ããŒã«ã«æšè«ãšã³ãžã³ãStrataãã¯ãQwen3.8-Flash-Next (125B MoE) ã 8GB 以äžã® NVIDIA GPU ãšã·ã¹ãã RAM ã§åããããã®ãœãããŠã§ã¢ã§ããOpenAI/Anthropic äºæ API ãæäŸããMIT ã©ã€ã»ã³ã¹ã§å ¬éãããŠããŸãã
ä»åã®æŽæ°ã§ã¯ãAMD Ryzen AI Max+ (Strix Halo) åã Windows ãµããŒãã®è¿œå ãRTX 5090 çã§ã®éååã¢ãã«åäœäžå ·åã®ä¿®æ£ããããŠãã«ãGPUç°å¢ã«ãããã¬ã€ã€åå²ã®æé©åãäž»ãªå€æŽç¹ã§ãã
ä»åã®èŠç¹
AMD Strix Halo (gfx1151) ã® Windows 察å¿ïŒRyzen AI Max+ æèŒæ©ã§ã®å©çšãå¯èœã«ãLinux åããµããŒãã«ç¶ããWindows ç°å¢ã§ã HIP çµç±ã§ã®æšè«ãåäœããããã«ãªããŸããã
RTX 5090 çã®éååäžå ·åä¿®æ£ïŒUnsloth UD-IQ4_XS éååã¢ãã«ã§ã®ããã³ããèªã¿èŸŒã¿å€±æããfused int8 ãã¹ã§ã®ã«ãŒãã«ãã³ã°ãå ±åãããåé¿çãä¿®æ£ãè¡ãããŸããã
ãã«ãGPUæé©åïŒè€æ°GPUã§ã®ã¬ã€ã€å岿ã«ããããã€ãã©ã€ã³åŠçã®æé©åïŒSTRATA_SPLIT_OVERLAPïŒãããããåŠçã®äžŠååã匷åãããŠããŸãã
CPUãšãã¹ããŒãã®é«éåïŒAVX2/AVX-512 察å¿ã®æ°ããã«ãŒãã«ã«ãããCPUäžã§åäœãããšãã¹ããŒãåŠçã®é床ãåäžããŠããŸãã
æ§äžä»£GPUã®æé©åïŒVolta (Tesla V100) ã Turing äžä»£åãã«ãBF16 æŒç®ã®é«éåãæ³šææ©æ§ã«ãŒãã«ã®æ¹åãæœãããŸããã
Strata v0.1.39 ãªãªãŒã¹ãšäž»èŠå€æŽç¹
Strata v0.1.39 ã§ã¯ãCUDAãHIPãSYCL åããã¯ãšã³ãã«å¯Ÿããæé©åãšä¿®æ£ãçµ±åãããŸãããç¹ã«æ³šç®ãã¹ãã¯ãæ§äžä»£ã® NVIDIA GPU åãããã©ãŒãã³ã¹æ¹åãšãAMD GPU åã Windows ãµããŒãã®è¿œå ã§ãã
Volta (Tesla V100) åãæé©å
Tesla V100 (sm_70) ã¯å ¬åŒã«ã¯ãµããŒãå€ã§ãããå®éšçãªãã«ãã«ãããŠããã³ããèªã¿èŸŒã¿éåºŠã®æ¹åãè¡ãããŸãããV100 㯠BF16 ãã³ãµãŒã³ã¢ãæããªããããåŸæ¥ã¯ CUDA ã³ã¢ã«ãŒãã«ã§ BF16 GEMM ãå®è¡ããŠããŸããããããã FP16 ãã³ãµãŒã³ã¢ãã¹ã«åãæ¿ããããšã§é«éåããŠããŸããããã«ãããV100 äžã§ã®ããã³ããåŠçæéãçŽ 10% æ¹åãããŸããããŸããæ³šææ©æ§ã«ãŒãã«ïŒattention kernelïŒã®æé©åã«ããã20K ããŒã¯ã³ã®ããªãã£ã«åŠçã«ãããè² æ ã軜æžãããŠããŸããhttps://github.com/Niko1221/Strata/pull/540
AMD RDNA3 (gfx1100) åã WMMA ã«ãŒãã«
AMD Radeon RX 6000 ã·ãªãŒãº (RDNA3) åãã«ãQSA ãããã¯ã¹ã³ã¢éžæ/ã¹ã³ã¢ã©ãŒãã¹ã«ããã WMMA ã«ãŒãã«ã远å ãããŸãããããã«ããã128K ã³ã³ããã¹ãã§ã®ããªãã£ã«åŠçã«ãããŠãçŽ 12-14% ã®ããã©ãŒãã³ã¹æ¹åãæåŸ ã§ããŸãããã®æ©èœã¯ `STRATA_SELECT_WMMA` ç°å¢å€æ°ã§æå¹åã§ããŸããhttps://github.com/Niko1221/Strata/pull/856
PageCache ã®ä¿®æ£ïŒ45åã®èªã¿åãå¢å¹ ã®è§£æ¶ïŒ
PLE (Page-Level Embedding) ã® PageCache ã«ãããŠãè¡ãã£ãã·ã¥ããããŒãžãã£ãã·ã¥ãžã®ç§»è¡ã«ãããã¡ã¢ãªå¹çãšæ£ç¢ºæ§ãåäžããŸãããåŸæ¥ãè¡ãã£ãã·ã¥ã¯ 4096 ãã€ãã®ããŒãžã®ãã¡ 90 ãã€ãã®ã¿ãä¿æããŠãããããããŒãžå¢çããŸããè¡ã®ã¢ã¯ã»ã¹æã« RAM ããã®åèªã¿åããçºçããæå€§ 45 åã®èªã¿åãå¢å¹ ãçããŠããŸãããããŒãžåäœã§ãã£ãã·ã¥ãè¡ãããšã§ããã®åé¡ãè§£æ¶ãããŸãããhttps://github.com/Niko1221/Strata/pull/855
GPU éžæã³ãã³ãã®æ¹å
æ°ãã `--gpu LIST` ãªãã·ã§ã³ã«ãããç°å¢å€æ° (`CUDA_VISIBLE_DEVICES`) ãèšå®ããã«ããšã³ãžã³å éšã§äœ¿çšãã GPU ãæå®ã§ããããã«ãªããŸãããããã«ãããã¹ã¯ãªãããèšå®ãã¡ã€ã«ããç¹å®ã® GPU ããã³çãããéã®èšå®ãç°¡çŽ åãããŸãããhttps://github.com/Niko1221/Strata/pull/852
AMD Strix Halo (gfx1151) Windows 察å¿ãšæ§èœæ¹å
Ryzen AI Max+ ã·ãªãŒãº (Strix Halo) æèŒæ©åãã«ãWindows ç°å¢ã§ã® Strata å©çšãæ£åŒã«ãµããŒããããŸãããããã«ãããçµ±åã¡ã¢ãªã¢ãŒããã¯ãã£ãæã€ AMD APU ãçšããå€§èŠæš¡èšèªã¢ãã«ã®ããŒã«ã«æšè«ããWindows ãŠãŒã¶ãŒã«ãéæŸãããŸããã
Windows ç°å¢ã§ã®ã¡ã¢ãªç®¡çãšãã«ã
Windows ç°å¢ã§ã¯ãAPU ã®ã¡ã¢ãªæ§æã Linux ãšç°ãªããããç¹å¥ãªåŠçãå¿ èŠã§ãããRyzen AI Max+ PRO 395 (Radeon 8060S, gfx1151) æèŒæ©ã§ã¯ãWindows 㯠47.8 GB ã® RAM ãå ±åãã衚瀺ã¬ãžã¹ããªã¯ 16 GB ã® VRAM ããHIP 㯠43.8 GiB (ã«ãŒãã¢ãŠã + å ±æ RAM) ãå ±åããŸããStrata ã®ã»ããã¢ããã¹ã¯ãªããã¯ããããã®å€ãæ£ããè§£éããã·ã¹ãã RAM ãžã®è¿œå è² è·ãé²ãããã«èª¿æŽãããŸãããhttps://github.com/Niko1221/Strata/pull/919
æ§èœæ¹åïŒçŽ 230 tok/s ããçŽ 700 tok/s ãž
Strix Halo (gfx1151) ã«ãããããã³ããåŠçã®é床ããçŽ 230 tok/s ããçŽ 700 tok/s (16Kã250K ã³ã³ããã¹ã) ã«å€§å¹ ã«æ¹åãããŸããããã®æ¹åã¯ãRDNA3/RDNA3.5 åãã« WMMA ãããªãã¯ã¹ã³ã¢ãçšããæ³šææ©æ§ã«ãŒãã«ãšéžæã¹ã³ã¢ã©ãŒã«ãŒãã«ã远å ãããããšã«ãããã®ã§ãããããã®ã«ãŒãã«ã¯ã`STRATA_HIP_WMMA=1` ããã³ `STRATA_SELECT_WMMA=1` ç°å¢å€æ°ã§æå¹åã§ããŸããhttps://github.com/Niko1221/Strata/pull/944
å©çšè ã®å ±å
å©çšè ã®å ±å
storm-ace æ°ã¯ãRyzen AI Max+ PRO 395 (Radeon 8060S, 64 GB RAM, 16 GB ã«ãŒãã¢ãŠã) æèŒã® Windows 11 æ©ã§ãgfx1151 åã Windows ãã«ããæ£åžžã«åäœããHIP ctest ããã¹ãããšå ±åããŠããŸããã¡ã¢ãªæ§æã®éããèæ ®ããã»ããã¢ãããæ£ããæ©èœããŠããããšã確èªããŸãããhttps://github.com/Niko1221/Strata/issues/918
Ultmate-hub æ°ã¯ãASUS ROG Strix G15 (RX 6800M, 12 GB VRAM) æèŒæ©ã§ãWindows 11 ç°å¢äžã«ãããŠèªåã§ãã«ããã HIP ãšã³ãžã³ãçšã㊠Strata 0.1.39 ãåäœãããŸããããã ããæšæºã®ã»ããã¢ããã¹ã¯ãªããã§ã¯ã«ãŒãã® PCI ID (0x73DF / gfx1031) ãèªèãããªãããã`setup.py` ã®ä¿®æ£ãå¿ èŠã§ãããèªåãã«ãã«ããæ£åžžã«åäœããŠããããšã確èªããŠããŸããhttps://github.com/Niko1221/Strata/issues/915
lollo78 æ°ã¯ãRTX 2060 (6 GB VRAM) + 32 GB RAM ç°å¢ã§ Strata ã®èµ·åã詊ã¿ãŸããããVRAM ã 12 GB æªæºã§ãããããã»ãšãã©ã®ãšãã¹ããŒãã CPU ã«æ®ããæšè«é床ãé ããªãèŠåã衚瀺ãããŸãããæ£åžžã«èµ·åã¯ããŸããããããã©ãŒãã³ã¹ã®äœäžãæžå¿µãããŸããhttps://github.com/Niko1221/Strata/issues/916
Unsloth UD-IQ4_XS éååã¢ãã«ã®åäœäžå ·åä¿®æ£
v0.1.39 ã«ãããŠãRTX 5090 (sm_120) ã RX 6900 XT (gfx1030) çã®ç°å¢ã§ãç¹å®ã®éååã¢ãã«ãèšå®ãçšããéã«ãã³ã°ãåºå厩ããçºçããäžå ·åãå ±åãããŸããããããã®åé¡ã¯ãMMQ (Multi-Mode Quantization) ããã³ãããã¹ã fuses int8 ãã¹ã«é¢é£ããŠããããšãç¹å®ãããŠããŸãã
RTX 5090 ã§ã® UD-IQ4_XS åºå厩ã
signalnine æ°ã¯ãRTX 5090 (sm_120) äžã§ Unsloth ã® UD-IQ4_XS éååã¢ãã«ãçšããéãããã³ããã MMQ ãã¹çµç±ã§èªã¿èŸŒãŸãããšãã¢ãã«ãå ¥åããç ŽæãŸãã¯æçåããšèªèããåºåãä¹±ããçŸè±¡ã確èªããŸãããç¹ã« 50 ããŒã¯ã³ãè¶ ããããã³ããã§é¡èã§ãã³ãŒãã®èŠçŽã誀ã£ãçš®é¡ã®ãã®ã«ãªãçã®åé¡ãçºçããŸããããã®åé¡ã¯ã`STRATA_PREFILL_MMQ=0` ç°å¢å€æ°ã§ MMQ ãã¹ãç¡å¹åããããšã§ãåãããã³ããé床ã§è§£æ¶ãããŸããããŸããåããã€ããªã RTX 3090 (sm_86) ã§äœ¿çšããå Žåã¯ãMMQ ãæå¹ã«ããŠãæ£åžžã«åäœããŸãããhttps://github.com/Niko1221/Strata/issues/968
RTX 5090 ã§ã® fuses int8 ã«ãŒãã«ãã³ã°
Krypto-Whitehat æ°ã¯ãRTX 5090 Laptop (sm_120) äžã§ã`STRATA_PF_FUSED=1` (fused int8 ããã³ãããšãã¹ããŒã) ãš #583 ã® byte-budget ring ã䜵çšããéãæåã®ããã³ããåŠçäžã« CUDA ã«ãŒãã«ããã³ã°ãã`prefill mmq: iota: unknown error` ãšã©ãŒã§çµäºããçŸè±¡ã確èªããŸããããã®åé¡ã¯ãbyte-budget ring ãç¡å¹å (`STRATA_RING_BYTES=0`) ããããšã§è§£æ¶ãããring ãš fused ããã³ãã¹ãã¹ã®çžäºäœçšã«åé¡ãããããšã瀺åãããŸãããv0.1.37 ã§ã¯ãã®åé¡ãªãåäœããŠãããããv0.1.39 ã§ã®ååž° (regression) ã§ãããšå ±åãããŠããŸããhttps://github.com/Niko1221/Strata/issues/954
RX 6900 XT ã§ã® verify ãã³ã°
xjc10 æ°ã¯ã2x RX 6900 XT (gfx1030, HIP, Linux) ç°å¢ã§ãçŽ 31K ããŒã¯ã³ã®ããã³ããåŠçåŸãæåã® verify ãŠã£ã³ããŠã§ãã³ã°ããçŸè±¡ã確èªããŸããããã®åé¡ã¯ãMMQ ããã³ãããã¹ããã©ã€ããªãŒã«ãŒãã®é©å¿çãšãã¹ããŒãã¹ã¯ãããSDMA ã³ããŒã®äžã€ãåæã«çºçããéã«åçŸãããããããç¡å¹åããããšã§åé¿ã§ããŸããããã©ã€ããªãŒã«ãŒã㯠98-99% ã®ããžãŒç¶æ ã§ãããããŠã§ãŒããã¬ãžãã³ãã§ã¯ãªããã³ãã³ãããã»ããµããŠã§ã€ãã§åæ¢ããŠããç¶æ ã§ãããhttps://github.com/Niko1221/Strata/issues/884
ãã«ãGPUã¬ã€ã€åå²ã®äžŠååãšæé©å
è€æ° GPU ãçšããã¬ã€ã€åå² (layer split) ã«ãããŠããã€ãã©ã€ã³åŠçãšãããæé©åã匷åãããŸãããããã«ãããè€æ° GPU ã䜿çšããå Žåã®ããã©ãŒãã³ã¹åäžãæåŸ ãããŸãã
ã¹ããŒãžéã®ãªãŒããŒã©ãã (STRATA_SPLIT_OVERLAP)
2x RX 7900 XTX ç°å¢ã§ã¯ãã¬ã€ã€å岿ã«ãã³ãŒãé床ãåäžã«ãŒããããäœäžããçŸè±¡ (#642) ãå ±åãããŠããŸãããããã¯ãå verify ãŠã£ã³ããŠå ã§ã¹ããŒãž 1 ãå®äºããåŸããã¹ããã¹ããªãŒã ãåæããã¹ããŒãž 2 ã®ã°ã©ããèµ·åããé åºã«èµ·å ããŠããŸãããHIP ç°å¢ã§ã¯ããã®åæãšã°ã©ãèµ·åãé«ã³ã¹ãã§ãããäž¡æ¹ã®ã«ãŒããã¢ã€ãã«ç¶æ ã«ãªãéã«ã¯ãªãã£ã«ã«ãã¹äžã«äœçœ®ããŠããŸãããhttps://github.com/Niko1221/Strata/pull/936
ãã®åé¡ã解決ããããã`STRATA_SPLIT_OVERLAP=1` ãªãã·ã§ã³ã远å ãããŸãããããã«ãããåãã³ããªããããã¡ã« ready ã¯ãŒããèšå®ãããæžã蟌ã¿ã¹ããŒãžã®ã°ã©ãçµäºæã« `handoff_publish` ãå®è¡ãããèªã¿åãã¹ããŒãžãéåæã§ããŒã¿ãåä¿¡ã§ããããã«ãªããŸãããããã«ãããã¹ããŒãžéã®åŸ æ©æéãåæžãããããã©ãŒãã³ã¹ãæ¹åãããŸããã
ãã€ãã©ã€ã³åŠçã®æé©å
åäžäŒè©±ã®ãã³ãŒããã·ãªã¢ã«ã«è¡ãããåé¡ã解決ããããã`--pipeline-windows 2` ãªãã·ã§ã³ã«ãããã¹ããŒãž 0 ããŠã£ã³ã㊠K+1 ãéå§ããéã«ãã¹ããŒãž 1 ããŸã ãŠã£ã³ã㊠K ãæ€èšŒããŠããéã«åŠçã䞊ååã§ããããã«ãªããŸãããããã«ãããK+1 ã®ååããã§ã«å®äºããç¶æ ãå®çŸãããŸãããŸããMTP (Multi-Token Prediction) ãã§ãŒã³ãçšããæšæž¬ã«ãããæ£è§£ã®å Žåã«ã¯åŠçãå éããäžæ£è§£ã®å Žåã«ã¯ç¶æ ã埩å ããŠåå®è¡ããä»çµã¿ãå°å ¥ãããŸãããhttps://github.com/Niko1221/Strata/pull/859
æ³šææ©æ§ããŒãžãš PLE ãªãŒãã¢ã©ãŠã³ã
2-GPU ãã³ãŒãã«ãããŠãéžæå¹ ã«å¶éãããæ³šææ©æ§ããŒãž (`STRATA_ATTN_MERGE_V2=1`) ã远å ãããŸãããããã«ãããRTX 5080 äžã§ 1 ã¯ãšãªãããã®åŠçæéã 98 µs ãã 21 µs ã«æ¹åãããŸããããŸããPLE (Page-Level Embedding) ã®ãªãŒãã¢ã©ãŠã³ããšæ©æãã§ãŒã³ããã€ãã©ã€ã³åãããè€æ° GPU ç°å¢ã§ã®åŠçå¹çãåäžããŸãããhttps://github.com/Niko1221/Strata/pull/910
CPUãšãã¹ããŒãã«ãŒãã«ã®AVX2/AVX-512æé©å
CPU äžã§åäœãããšãã¹ããŒãã«ãŒãã«ã®æé©åãé²ã¿ãŸãããç¹ã«ãAVX2 ããã³ AVX-512 察å¿ã®æ°ããã«ãŒãã«ã«ããããã£ãã·ã¥ãã¹æã®åŠçé床ãåäžããŠããŸãã
Trellis ã¿ã€ãã® AVX2/AVX-512 ã«ãŒãã«
16-24 GB ã® VRAM ãæã€ã«ãŒãã§ã¯ããã¹ãŠã®ãšãã¹ããŒããä¿æã§ããªãããããã£ãã·ã¥ãã¹ãçºçãããš CPU ã¯ãŒã«ãŒã§åŠçãè¡ãããŸããTrellis ã¿ã€ã (TQ2_T / TQK6 / TQK7) ã®å ŽåãåŸæ¥ã¯ ggml-cpu ã® `vec_dot` ãçšããŠããŒã¯ã³ããšã«åŠçãããŠããŸããããStrata ç¬èªã® AVX2 ããã³ AVX-512 ãã³ãŒãã»ã¢ã³ãã»ãããã«ãŒãã«ã远å ãããŸãããããã«ãããå 128 éã¿ãããã¯ãäžåºŠã ããã³ãŒãããããã®ãšãã¹ããŒãã«ã«ãŒãã£ã³ã°ããããã¹ãŠã®ããŒã¯ã³ã§åå©çšããããããåŠçå¹çãåäžããŸãããhttps://github.com/Niko1221/Strata/pull/933
IQ3_S / IQ2_S ã® AVX2 ãã³ãŒãæé©å
IQ3_S ããã³ IQ2_S ã® AVX2 å€ããŒã¯ã³ã«ãŒãã«ã«ãããŠãã³ãŒãããã¯ãã³ãŒãã®èšç®ã³ã¹ããåæžãããŸãããã°ãªããã€ã³ããã¯ã¹ã®åç §æ¹æ³ã倿Žãããåã«ãã¯ã¢ãããã·ããããã¹ã¯ãOR ã®ä»£ããã« 16 ãããããŒããšã°ãªããããŒãã®ã¿ã§å®è¡ãããããã«ãªããè¡ãããã®åŠçæéã 1.07ã1.6 åæ¹åãããŸãããæŒç®ã¯å€æŽãããŠããªããããçµæã¯ãããåäœã§åäžã§ããhttps://github.com/Niko1221/Strata/pull/930
Gathered Grid Decode ã®å°å ¥
Intel P-core (Alder Lake 以é) ã«ãããŠãgathered grid decode ãæå¹åãããŸãããããã«ãããFmt32<118>/<121>/<122> 圢åŒã®ãã³ãŒããé«éåãããŸããããŸããAVX-VNNI 察å¿ã®è¡åŠçããIQ3_S ã®åäžããŒã¯ã³ã«ãŒãã«ã远å ãããŸãããhttps://github.com/Niko1221/Strata/pull/863
ãã®ä»ã®å€æŽç¹
ããŒã«ã³ãŒã«ã®èªåæèçµäº
Qwen3 ç³»ã¢ãã«ãæè (``) ãåºåããã«ããŒã«ã³ãŒã« (``) ã«ç§»è¡ããã±ãŒã¹ã«å¯Ÿå¿ããŸããã`` ãæªéãã®æèã¹ãã³ã®çµäºãæå³ããããã«ãªããã¯ã©ã€ã¢ã³ããããŒã«ã³ãŒã«ãæ£ããèªèã§ããããã«ãªããŸãããhttps://github.com/Niko1221/Strata/pull/939
ã¬ã€ã€å岿ã®ãããåŠçä¿®æ£
RTX 3070 ãš Tesla P40 ãçµã¿åãããã¬ã€ã€åå²ç°å¢ã§ã`--batch` ãªãã·ã§ã³äœ¿çšæã«ãšã©ãŒãçºçããåé¡ãå ±åãããŸãããGPU ã®é åºã«ãã£ãŠåçŸã»éåçŸãåããããããå éšã®åæåŠçã«åé¡ãããå¯èœæ§ã瀺åãããŠããŸããhttps://github.com/Niko1221/Strata/issues/929
CUDA 13.2 ã§ã® sm_120 äºææ§åé¡
Linux ç°å¢ã§ CUDA 13.2 ãçšã㊠RTX 5070 Ti (sm_120) åãã«ãã«ãããéããã¹ãŠã®åçãäžæ£ã«ãªãçŸè±¡ãå ±åãããŸãããCUDA 13.0 ã§ã¯æ£åžžã«åäœãããããCUDA 13.2 ã«ãããã³ã³ãã€ã«åé¡ãçãããŠããŸããhttps://github.com/Niko1221/Strata/issues/892
åºå ž
#540 volta (sm_70) and turing (sm_75): faster prompt reading
#856 hip: RDNA3 (gfx1100) WMMA kernel for the QSA block-score select/scorer
#858 gfx906 compat: cudaFuncSetAttribute as a template function
#853 cuda: specialize hyper-connection up for short verify windows
#852 engine: --gpu selects the visible GPUs without environment variables
#944 hip: gfx11 WMMA prompt attention and selection scorer, gfx1151 hipBLASLt table
#918 Windows: Radeon 8060S (gfx1151) builds, selftests and passes the HIP ctest
#916 Unable to launch Strata on RTX 2060 6GB VRAM + 32 GB RAM
#915 Windows AMD report: RX 6800M (gfx1031, laptop) works with a self-built HIP engine
#968 0.1.39: UD-IQ4_XS prompts read as garbage on an RTX 5090
#884 HIP gfx1030, 2x RX 6900 XT: verify hangs after a long prompt
#954 [BUG] 0.1.39: fused int8 prompt experts + #583 byte-budget ring â kernel hang
#939 serve: a tool call written inside an unclosed thinking span is an implicit think end
#929 --batch with --layer-split exits with a 3070 first and a P40 second
#892 Linux + RTX 50 (sm_120): an engine compiled with CUDA 13.2 answers garbage
#859 Layer split: pipelined verify windows for one conversation
#910 Two-GPU decode: bounded attention merge and pipelined PLE read-ahead
#904 Verify window: PDL on sm_90+, graph branches, batched Q4_0 KV append
#933 CPU trellis kernels (AVX2 / AVX-512) for TQ2_T / TQK6 / TQK7 expert-cache misses
#930 cpu: IQ3_S / IQ2_S AVX2 decode without the per-index shift/mask/or
#863 cpu kernels: gathered decode on the cores where it is faster, AVX-VNNI rows
#903 prefill: a prompt reads in equal chunks; a short streaming tail stays
å©çšè ã®å ±å
RTX 4090 (Ubuntu, Xeon) ç°å¢ã§ Qwen3.8-Flash-Next IQ2_XS ãå®è¡ããçµæãã²ãŒã çæã¯å®è¡ããããã®ã®ç©çæŒç®ãã²ãŒã æ§ãè²§åŒ±ã§æåŠãããã darkerow
2à RTX 3060 (Q2_0/IQ3_S) ç°å¢ã§ãã³ãããŒã¯ã宿œããQ2_0ã¯åäžå®è¡ãIQ3_Sã¯3åå®è¡ã®äžå€®å€ãšç¯å²ãå ±åããã zimuhuan-code
RTX 5070 Ti (Windows) ç°å¢ã§ Qwen3.8-Flash-Next IQ3_S ãå®è¡ãããšãããStrataã®ãã£ãªãã¬ãŒã·ã§ã³å€ã¯çŽ14 tok/sãå¶åŸ¡ããããã¹ãã§ã¯9-10 tok/sãšäºæ³ããäœãçµæãšãªã£ãã annD-annD
RTX 5070 Ti (Windows) ç°å¢ã§GPUè² è·ã¯é«ããã®ã®é»åã60Wæªæºã«æããããŠããçŸè±¡ã«ã€ããŠãPCIe Gen5ãOS/BIOSã¬ãã«ã®çé»åèšå®ãèŠå ã§ããå¯èœæ§ãææããã dandandelion