OpenAI开源Codex Agent Harness、GPT Image新检查点曝光、腾讯灰测混元Hy4 | 8月21日 AI日报

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

💡 今日趋势速览:OpenAI开源Codex背后的Agent Harness,官方强调harness设计直接影响模型表现;腾讯元宝App灰测专家级旗舰模型混元Hy4,多模态能力将升级;GPT Image新检查点luna-lisa-alpha曝光,图像输出更干净。厂商竞相迭代智能体框架与多模态模型,竞争加速。

🎯 今日要点

  1. OpenAI 开源 Codex 背后的 Agent Harness
  2. GPT Image 新检查点 luna-lisa-alpha 曝光
  3. 腾讯元宝 App 灰测新旗舰模型混元 Hy4

📋 今日内容汇总

🤖 AI动态

  1. OpenAI 开源 Codex 背后的 Agent Harness
  2. GPT Image 新检查点 luna-lisa-alpha 曝光
  3. 腾讯元宝 App 灰测新旗舰模型混元 Hy4
  4. OpenAI 预览 Private Safety Processing 安全服务
  5. 阿里推出 GUI 智能体基座模型 Qwen-UI-Agent
  6. Claude Code 新增 Concise 输出风格
  7. Unsloth Desktop 新版上线:支持自动压缩
  8. Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型
  9. MiniMax 发布多模态创作 Agent MiniMax Design
  10. 隐形前沿模型 Ox Alpha 上线:百万 token 上下文
  11. Cursor 上线 /goal:给 Agent 一个长期目标
  12. 商汤开源 8B 统一多模态模型 SenseNova U1.5 Lite
  13. Slack 推出 Slack Code,频道内直接协作编程智能体
  14. 豆包视频通话升级,可同时处理音视频文本三路输入

🦾 机器人具身智能

  1. AGIBOT 发布新一代全尺寸人形机器人 A3

📦 开源项目

  1. Claude 文本水印被破解,相关项目 Star 超 1.5 万

📌 模型排行榜

  1. Artificial Analysis AI 模型能力排行榜

🤖 AI动态

1. OpenAI 开源 Codex 背后的 Agent Harness

OpenAI开源Agent Harness,Codex App、CLI与IDE扩展背后运行该框架,官方强调harness设计直接影响模型表现,ARC-AGI-3上GPT-5.6 Sol加入retained reasoning后分数从13.3%涨至38.3%集成方式分三种:codex exec适合脚本、CI Job等非交互任务

OpenAI 开源 Codex 背后的 Agent Harness

OpenAI 开源 Codex 背后的 Agent Harness

🔗 https://x.com/linxiaobei888/status/2090240944536994014


2. GPT Image 新检查点 luna-lisa-alpha 曝光

LMArena 上出现代号 luna-lisa-alpha 的 GPT Image 新检查点,被多个追踪者独立发现,属预发布版本且不可选用,来源实验室未知。早期输出显示图像更干净,颗粒噪点基本消失,角色一致性与文本渲染提升,知识截止时间较前代 mona-lisa-1 更新。

GPT Image 新检查点 luna-lisa-alpha 曝光

🔗 https://x.com/Adidotdev/status/2090405864335462895


3. 腾讯元宝 App 灰测新旗舰模型混元 Hy4

腾讯元宝App模型列表中出现混元Hy4,标注为专家级模型,排在Hy3与DeepSeek上方。腾讯上周在Q2财报确认Hy4即将上线,提升性能与多模态能力;目前尚未正式发布,或为小范围灰测。

腾讯元宝 App 灰测新旗舰模型混元 Hy4

腾讯元宝 App 灰测新旗舰模型混元 Hy4

🔗 https://x.com/MaxForAI/status/2090386754633421110


4. OpenAI 预览 Private Safety Processing 安全服务

OpenAI推出Private Safety Processing服务,面向符合条件的企业与API客户,使用前沿模型时保持零数据保留:系统跨多轮对话检查潜在滥用,OpenAI员工无法查看客户的提示词或模型响应。Sam Altman在推文中表示支持商业隐私,OpenAI为前沿模型提供零数据保留服务

OpenAI 预览 Private Safety Processing 安全服务

OpenAI 预览 Private Safety Processing 安全服务

🔗 https://x.com/0xLogicrw/status/2090282580625314202


5. 阿里推出 GUI 智能体基座模型 Qwen-UI-Agent

阿里巴巴发布Qwen-UI-Agent,能直接操作手机、电脑、网页,遇命令行任务可运行CLI。阿里做GUI Agent已两年多,2024年Mobile-Agent靠截图控制点击Qwen-UI-Agent覆盖移动端、桌面端、浏览器、DeepSearch及CLIQwen-UI-Agent在MobileWorld-Real等评测中获92.2%成绩

阿里推出 GUI 智能体基座模型 Qwen-UI-Agent

阿里推出 GUI 智能体基座模型 Qwen-UI-Agent

阿里推出 GUI 智能体基座模型 Qwen-UI-Agent

🔗 https://x.com/0xLogicrw/status/2090387625979031686


6. Claude Code 新增 Concise 输出风格

新版输出风格 Concise 已上线 Claude Code:先直接给出结果、保持回复简短,被追问时仍会提供完整细节。用户可以在 /config 设置菜单的 Output style 选项中开启。

Claude Code 新增 Concise 输出风格

🔗 https://x.com/ClaudeDevs/status/2090245922685063634


7. Unsloth Desktop 新版上线:支持自动压缩

Unsloth Desktop 发布新版本:带来面向所有模型的实验性自动压缩(结合 RAG、强制首轮 RAG 与尾部保留策略)、局域网和远程访问选项卡以及更流畅的聊天体验,本版还合并了 200 多个 PR。

Unsloth Desktop 新版上线:支持自动压缩

🔗 https://x.com/danielhanchen/status/2090499172118241668


8. Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型

DSpark 草稿模型通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍;草稿模型约 300M 参数,LFM2.5-2.6B 的函数调用延迟平均降低 57%,已开源并支持 llama.cpp 与 SGLang以下是官方给出的 demo

Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型

Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型

🔗 https://huggingface.co/blog/LiquidAI/lfm25-dspark


9. MiniMax 发布多模态创作 Agent MiniMax Design

它能自主拆解任务、写脚本、做分镜,生成图片和视频后完成剪辑、配音与字幕,直接交付成片。MiniMax 把视频模型 H3 深度整合进 Agent 与 Skills,按任务判断素材取舍并整理成适合 H3 执行的输入,复杂镜头还可先用 3D 导演台编排以下是官方给出的 demo

MiniMax 发布多模态创作 Agent MiniMax Design

🔗 https://mp.weixin.qq.com/s?__biz=MzE5MTA3NzcxMQ==&mid=2247489087&idx=1&sn=2691288eb8cddac6c2e86483ccff7eb5


10. 隐形前沿模型 Ox Alpha 上线:百万 token 上下文

一款未公开厂商的隐形模型 Ox Alpha 发布,定位高效编程、持续性智能体工作与真实生产环境,提供 100 万 token 上下文窗口,输入支持 Text、image 与 video 三类模态,官方邀请用户试用并反馈。

隐形前沿模型 Ox Alpha 上线:百万 token 上下文

🔗 https://x.com/OpenRouter/status/2090544970923184269


11. Cursor 上线 /goal:给 Agent 一个长期目标

Cursor刚刚推出/goal功能,给智能体设定长期目标后可持续工作直至真正完成,示例为打造超越《使命召唤》的AAA级FPS游戏。/goal还能搭配/loop进行定期检查,再结合Custom Mode制定执行手册。

Cursor 上线 /goal:给 Agent 一个长期目标

Cursor 上线 /goal:给 Agent 一个长期目标

🔗 https://x.com/minchoi/status/2090233324727832638


12. 商汤开源 8B 统一多模态模型 SenseNova U1.5 Lite

SenseNova U1.5 Lite参数量仅80亿,是轻量级原生统一多模态模型,支持视觉理解、生成与编辑。SenseNova系列在图像生成与编辑的多个基准测试中表现领先。它支持原生4K生成与复杂指令遵循,可按主体、数量、文本、布局和风格控制输出,目前代码已开源

商汤开源 8B 统一多模态模型 SenseNova U1.5 Lite

商汤开源 8B 统一多模态模型 SenseNova U1.5 Lite

商汤开源 8B 统一多模态模型 SenseNova U1.5 Lite

🔗 https://x.com/SenseTime_AI/status/2090483079412580442


13. Slack 推出 Slack Code,频道内直接协作编程智能体

面向编程智能体的 Code channels 现已上线,这套功能被命名为 Slack Code,首批合作方包括 Anthropic、GitHub、Cognition 和 Vercel。用户可以在频道中直接与 Coding Agent 协作干活,这类智能体自 2024 年 Devin 起已能从 Slack 接收任务

Slack 推出 Slack Code,频道内直接协作编程智能体

🔗 https://x.com/Benioff/status/2090240159115853956


14. 豆包视频通话升级,可同时处理音视频文本三路输入

升级后的豆包视频通话能在连续变化的真实场景中自然连续交互,底层由火山引擎多模态传输系统提供技术支撑。看到路牌会提醒方向,也不被旁人对话带偏。用户能边看边听边说,AI同时接收音频、视频、文本三路输入,不必等它说完才开口。

豆包视频通话升级,可同时处理音视频文本三路输入

豆包视频通话升级,可同时处理音视频文本三路输入

🔗 https://mp.weixin.qq.com/s?__biz=MzI1MzYzMjE0MQ==&mid=2247521377&idx=1&sn=3d2f9e30616aa074c8d574c568903ba8


🦾 机器人具身智能

15. AGIBOT 发布新一代全尺寸人形机器人 A3

AGIBOT 摘下面具正式发布新一代全尺寸人形机器人 A3,官方演示强调其动作强劲、反应迅捷且精准毫厘不差,并让一位深谙如何逼近极限的大师担任陪练,以一场挑战赛展示 A3 的全身控制实力以下是官方给出的 demo

AGIBOT 发布新一代全尺寸人形机器人 A3

🔗 https://x.com/AGIBOTofficial/status/2090438452990857376


📦 开源项目

16. Claude 文本水印被破解,相关项目 Star 超 1.5 万

Anthropic已宣布8月2日之后新发布的Claude模型会在生成文本中嵌入肉眼不可见的水印标识,最初是为应对欧盟相关要求,其他AI厂商也有类似做法。如今有项目实现对这层水印的破解,在GitHub上收获超过15000个Star

Claude 文本水印被破解,相关项目 Star 超 1.5 万

Claude 文本水印被破解,相关项目 Star 超 1.5 万

🔗 https://mp.weixin.qq.com/s?__biz=MzAxOTcxNTIwNQ==&mid=2457995251&idx=1&sn=1d8e787f39931afc3cb37af299c2c20a


📌 模型排行榜

17. Artificial Analysis AI 模型能力排行榜

最后是今日的 AI 模型能力排行榜单,智力榜上,Claude Opus 5 (max) 以63分居首,Claude Fable 5 与 GPT-5.6 Sol、Grok 4.6 紧随其后。

Artificial Analysis AI 模型能力排行榜

Artificial Analysis AI 模型能力排行榜

🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs

以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

AI 时代程序员必备技能

Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活

内容概要:本文围绕“基于改进秃鹰算法的微电网群经济优化调度”展开研究,提出了一种改进的秃鹰搜索算法(BES),旨在解决微电网群在复杂运行环境下的多目标、强约束、非线性及高维经济调度问题。通过引入特定优化策略,增强了基础算法的全局搜索能力和收敛效率,克服了传统智能算法易陷入局部最优的缺陷。研究构建了一个包含分布式电源、储能系统与多元负荷的微电网群调度模型,以最小化系统综合运行成本为核心目标,综合考虑功率平衡、设备出力能力、储能运行特性等多重约束条件。通过仿真实验验证了所提算法在调度精度、稳定性和计算效率方面相较于传统方法具有明显优势,并进一步展示了其在降低能源开支、提升可再生能源消纳水平方面的实际应用价值。; 适合人群:具备一定电力系统基础知识或优化算法背景,从事能源调度、智能优化算法研究与应用等相关领域的研究生、科研人员及工程技术人员。; 使用场景及目标:①应用于微电网群、综合能源系统等场景下的经济调度优化;②为秃鹰算法及其他群体智能算法的改进、复现与性能对比提供参考范例;③服务于科研仿真、算法验证及工程化应用需求。; 阅读建议:建议读者结合文中提供的Matlab代码实现进行实践操作,重点关注算法改进机制与调度模型的构建逻辑,同时可借助网盘资源获取完整资料,以加深对算法性能表现与应用场景的理解
内容概要:本文围绕“多种改进粒子群算法在深度神经网络卸载策略中的比较研究”展开,系统探讨了边缘计算环境下基于启发式优化算法的DNN任务卸载问题。文章首先剖析了传统粒子群算法(PSO)的基本原理及其在收敛性和全局搜索能力方面的局限性,继而深入介绍四种代表性改进算法:自适应权重PSO、混合遗传PSO、模拟退火PSO以及多目标PSO,详述其在提升寻优效率、增强鲁棒性及应对复杂多约束场景下的机制与优势。研究通过构建DNN卸载模型,设计多维度性能评估体系,在延迟、能耗、资源利用率等关键指标上对各类算法进行对比实验分析,进而提出面向不同应用场景的算法选型策略与优化建议。该工作为边缘智能系统中的计算任务调度提供了理论支撑与实践指导。; 适合人群:具备一定人工智能与优化算法基础,从事边缘计算、物联网、智能系统优化等相关领域的研究生、科研人员及工程技术人员。; 使用场景及目标:① 掌握多种改进粒子群算法的核心思想与实现机制;② 理解深度神经网络在边缘-云协同环境下的任务卸载建模方法;③ 学习如何通过仿真实验对比不同启发式算法的性能差异,并根据实际需求选择最优算法方案; 阅读建议:建议结合提供的Matlab代码实现进行动手实践,重点关注算法参数调优、适应度函数设计及实验结果可视化分析过程,以深入理解算法行为与系统性能之间的内在关联。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

一只云卷云舒

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值