AI 日报 | 2026年8月13日
AI 日报 | 2026年8月13日:DeepSeek V4 Pro 与 Grok 4.6 同日对决、微软首发自研推理模型、阿里开源 2.4T 千问旗舰
今日要点速览
| 领域 | 核心事件 |
|---|---|
| 模型对决 | DeepSeek V4 Pro 与 Grok 4.6 2小时内同日发布,均为 1.5T+ 参数,逼近 Claude Fable 5 |
| 模型发布 | 阿里开源 Qwen3.8-2.4T-A95B、微软首发自研推理模型 MAI-Thinking-1 |
| 多智能体研究 | Anthropic 研究:45个协调智能体发现266个漏洞,个体良性行为可叠加为系统性失败 |
| 产品更新 | Claude in Chrome 升级为 Cowork 会话、OpenRouter 发布实时网页搜索基准 |
| 行业观察 | AutoGPT 用 CLA 签名当"人类探测器"、LLM 长文写作能力停滞 |
一、模型对决
1. DeepSeek V4 Pro 与 Grok 4.6 同日发布,双双逼近 Claude Fable 5
来源:公众号:数字生命卡兹克 / xAI / Cursor Blog · 北京时间 08-13 06:22

2小时内,两个重量级模型先后登场:
DeepSeek V4 Pro:正式版发布,1.6T 参数规模,逼近 Claude Fable 5 体验。延续 DeepSeek 一向的高性价比路线,在编码和推理基准上表现强劲。
Grok 4.6:xAI 发布,1.5T 参数,重点强化长时运行智能体及更复杂的交互式与视觉工作能力。在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。Cursor 与 SpaceXAI 联合发布,意味着 Grok 4.6 将深度集成到 Cursor 编程环境中。
二、模型发布与更新
2. 阿里开源 Qwen3.8-2.4T-A95B:千问旗舰首次开源
来源:IT之家 · 北京时间 08-13 00:10
阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。SGLang 与 Miles 已提供 Day-0 支持。
3. 微软首发自研推理模型 MAI-Thinking-1
来源:X:Mustafa Suleyman(Microsoft AI CEO)· 北京时间 08-13 00:00
微软发布首个从零构建的推理模型 MAI-Thinking-1,现已在 Microsoft Foundry 上线。这意味着微软不再仅依赖 OpenAI 模型,开始构建自有的推理模型能力。微软 AI CEO Mustafa Suleyman 亲自官宣。
4. LTX-2.5:10 秒 720P 视频仅需 6.8 秒生成
来源:IT之家 · 北京时间 08-12 14:46
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。10 秒片段成本仅 0.90 美元;年营收低于 1000 万美元的组织可免费使用。AI 视频生成进入实时时代。
三、前沿研究
5. Anthropic 研究:多智能体系统的模式与问题
来源:Anthropic Research · 北京时间 08-13 09:20
Anthropic 发布重要研究,指出随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。
实验核心数据:
- 45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞
- 独立并行方法在 650 万 token 中发现 21 个
- 两种方法仅 12 个重叠,互补性极强
- 协调智能体学会了专业化分工
关键警示:个体层面的良性行为怪癖可能叠加为意外的系统性失败。这是多智能体系统从实验室走向生产环境必须解决的核心问题。
6. Google 研究:Recall 是参数化事实性的瓶颈
来源:Google Research · 北京时间 08-13 01:57
Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。
该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。
四、产品发布与更新
7. Claude in Chrome 侧边栏升级为 Claude Cowork 会话
来源:Claude Blog · 北京时间 08-13 04:15
Claude in Chrome 浏览器扩展的侧边栏升级为 Claude Cowork 会话,对话保存至历史记录,技能和连接器可在浏览器中工作,任务可在桌面、网页和移动端应用间无缝切换。Anthropic 正在构建跨平台的工作连续性。
8. OpenRouter 发布实时网页搜索基准
来源:OpenRouter · 北京时间 08-12 23:45
OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。核心发现:将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要(平均分差 15 分 vs 10 分)。
9. Meta 开源 Muse Glimmer 登陆 OpenRouter
来源:X:OpenRouter · 北京时间 08-12 20:00
Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线。30B 密集文本+图像模型,Apache 2.0 许可证,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。
10. WhatsApp 推出 Scam Alert 反诈提醒
来源:Meta Engineering Blog · 北京时间 08-12
WhatsApp 推出可选功能 Scam Alert,通过端到端加密保护下在设备端运行机器学习模型,识别潜在反诈消息。遵循三大原则:仅设备端处理、无自动上报、用户控制。模型权重公开供独立验证,遥测数据经差分隐私聚合处理。
五、行业观察
11. AutoGPT 用 CLA 签名当"人类探测器"
来源:GitHub Blog · 北京时间 08-13 02:00
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。
其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。开源项目正加速适应 AI-first 的贡献者生态。
12. LLM 长文写作能力停滞
来源:Nathan Lambert:Interconnects · 北京时间 08-12 21:01
作者在完成一本 RLHF 教科书后反思:LLM 在编码、数学等任务已接近超人水平,但长文非虚构写作进展停滞。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,这阻碍了模型自主解决开放科学问题。
13. Research Gold:"100% 人类撰写"实为 AI 全程驱动
来源:Hacker News · 北京时间 08-12 13:41
面向医学研究者的网站 Research Gold 宣称"100% 由人类撰写、绝不使用 AI",但调查发现审稿人系 AI 生成、不存在;真实方法学家身份和照片未经许可被挪用;"客服 Sarah"实为 AI 助手却坚称自己是真人。
今日热点榜 Top 10
| 排名 | 事件 | 信号数 | 报道媒体数 |
|---|---|---|---|
| 1 | DeepSeek V4 Pro 与 Grok 4.6 同日发布 | 15 | 5 |
| 2 | Cursor 与 SpaceXAI 联合发布 Grok 4.6 | 5 | 8 |
| 3 | NVIDIA 推出 Nemotron 3.5 Lightning(延续热度) | 7 | 10 |
| 4 | Gemini 月活 10 亿(延续热度) | 4 | 8 |
| 5 | 阿里开源 Qwen3.8-2.4T-A95B | 2 | 2 |
| 6 | NVIDIA 携手六大机构成立 AI 工厂融资平台 | 0 | 4 |
| 7 | 英伟达研发万亿参数 Nemotron 4 | 5 | 2 |
| 8 | 加密推理轨迹可跨会话窃取(延续热度) | 0 | 5 |
| 9 | Anthropic 最快 9 月上市(延续热度) | 2 | 4 |
| 10 | 蚂蚁百灵 Ling-3.0-tiny 开源(延续热度) | 0 | 3 |
今日趋势总结
"千词级"模型在同一天正面交锋,智能体能力也因此成为新的关注重点:DeepSeek V4 Pro 与 Grok 4.6 同日亮相,并共同释放出一个清晰信号——长时运行智能体正在成为核心方向。Grok 4.6 明确加强了"长时运行智能体能力",并已追平 GPT-5.6 Sol;而 DeepSeek V4 Pro 则继续凭借性价比优势向市场发起冲击。可以看到,模型竞争的主战场正从"谁更聪明"逐步转向"谁能持续干得更久"。
开源旗舰密度创下新高:阿里 2.4T 千问旗舰开源、Muse Glimmer 上线 OpenRouter、Nemotron 3.5 Lightning 持续发酵——仅48小时内就有3个重量级开源模型释放。开源不再只是"平替",正在成为真正可选的生产级方案。
多智能体正从“能用”迈向“可控”阶段:Anthropic 的研究第一次较为系统地揭示了多智能体系统中的涌现风险——原本看似良性的个体行为,在叠加后可能演变为系统性的失败。AutoGPT 提出的 AGENTS.md + CLA 签名“人类探测器”,则可以看作工程实践层面的一种回应。当智能体开始彼此协作、相互交互时,究竟由谁来确保整个系统不会走向失控?
数据来源:[AIHOT] | 本文内容基于 AIHOT API 实时数据整理
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名