每周AI工具/模型更新报告(2026.08.10-2026.08.16)
一、开源模型重大突破
1. 中国开源模型全球领跑,Qwen生态衍生超15万模型
Hugging Face报告显示,2026年以来中国开源模型参数规模达7540亿至2.78万亿,远超美国同期的1300亿以下。Qwen已成为开源生态重要基础模型,衍生模型数量超15万个 。
2. 阿里Qwen3.8系列双模型齐发,旗舰权重首次开放
阿里千问团队宣布Qwen3.8-27B正式开源,可在高端手机和消费级显卡流畅运行;同时首次开放Max级别旗舰模型Qwen3.8-2.4T-A95B权重,总参数2.4万亿,采用稀疏MoE架构 。
3. Meta发布Muse Glimmer 30B,支持多模态本地运行
Meta发布约300亿参数的Dense模型Muse Glimmer,支持文本与图像多模态输入,上下文长度128k,定位为可在单张显卡Mac或PC上运行Agent任务的本地模型 。
二、Agent能力跨越式升级
4. DeepSeek V4 Pro正式版上线,Agent能力跃升15.8分
DeepSeek-V4-Pro正式版在Terminal Bench 2.1上得分87.9分,距全球第一仅差0.1分,相比预览版跃升15.8分;DeepSWE软件工程能力测试分数从12.8分飙升至62.7分 。
5. DeepSeek Harness框架发布,插件式架构重构Agent生态
DeepSeek发布Harness开发者预览版,采用"一切皆插件"设计思路,模型、工具、技能、会话等所有Agent能力均可自由替换、灵活重组,开发者无需改动源码即可扩展任一能力 。
6. Qwen3.8-Max-Preview支持长周期自主Agent任务
通义千问新一代旗舰预览基座支持上千次连续工具调用,解决传统大模型连续工具调用后目标遗忘、逻辑断裂问题,可自主完成完整软件项目开发全流程 。
三、API服务与推理优化
7. DeepSeek API三项升级,峰谷计价优化资源分配
API原生支持OpenAI Responses API格式,针对Codex场景深度适配;思考模式新增low/high/max三档强度调节;采用峰谷计价模式,闲时收费标准降至高峰时段一半 。
8. 智谱GLM-5.3后训练Scaling,编程能力提升50%
智谱发布GLM-5.3,基座模型不变,仅靠后训练将编程能力提升50%,在TerminalBench 3.0、Agents' Last Exam等公开基准测试中取得开源第一 。
四、核心能力对比总览
| 模型/工具 | 核心能力 | 参数规模 | 特色亮点 |
|---|---|---|---|
| Qwen3.8-Max | 多模态+长周期Agent | 2.4万亿(MoE) | 百万Token上下文,原生多模态 |
| DeepSeek V4 Pro | Agent任务执行 | - | Terminal Bench 87.9分,100万Token |
| DeepSeek Harness | Agent管控框架 | - | 插件式架构,自由替换扩展 |
| GLM-5.3 | 编程+网络安全 | - | 后训练提升编程能力50% |
| Muse Glimmer | 本地多模态Agent | 300亿 | 单显卡运行,128k上下文 |
五、配图说明
⚠️ 注意:本次搜索结果中未包含可直接引用的文章配图。建议访问以下原文链接获取相关配图:
六、本周趋势洞察
本周AI领域呈现三大核心趋势:开源权重成为竞争新战场,中国模型在参数规模和生态建设上全面领先;Agent能力从概念走向实用,DeepSeek Harness等框架让智能体真正具备自主任务执行能力;推理优化与成本控制并重,峰谷计价、MoE架构等技术手段在保障性能的同时降低使用门槛 。
开源正在从"低价竞争工具"转变为"能力可信度的证明工具",中国"开源模型+国产芯片"的绑定战略价值日益凸显,未来三年竞争焦点将从"被使用的次数"转向"被支付的金额" 。
参考来源
- 全球开源AI大洗牌 中国开源模型加速崛起_腾讯新闻
- 又一国产AI大模型宣布开源,国产大模型掀起开源潮_央广网
- 全球开源AI大洗牌 中国开源模型加速崛起_新浪财经_新浪网
- 大模型“一周三更”:DeepSeek涨价、阿里云开源、智谱“不换药”_腾讯新闻
- DeepSeek V4 Pro正式版来袭:Agent能力跃升 定价更灵活惠及用户_任务_模式_服务
- AI应用周度观察(2026.08.10-2026.08.16)|DeepSeek-V4|AI智能|魔搭社区ModelScope|Agent|开源模型_手机新浪网
- 最新版通义千问(Qwen3.8‑Max‑Preview)功能介绍-阿里云开发者社区

3310

被折叠的 条评论
为什么被折叠?



