DECOHACK

Juya AI Daily · 橘鸦 AI 早报

AI 早报 2026-09-22

要闻

1

小米发布并开源MiMo-V2.6系列模型

小米 MiMo 正式发布并开源 MiMo-V2.6,包括 Pro 和 Flash 两个原生全模态模型,并提供最高 20 倍 速度的 Pro UltraSpeed 模式。Pro 版为 1.02T 总参数、42B 激活参数,Flash 版为 309B 总参数、15B 激活参数,均支持文本、图像、视频、音频和 1M Token 上下文。小米同时开源模型权重、技术报告、Distill-Qwen-9B 模型、7K+ RL 环境及完整训练框架;新模型定价不变,旧版 mimo-v2.5-pro 和 mimo-v2.5 将于 10 月 21 日 下线。

小米 MiMo 正式发布并开源 MiMo-V2.6 系列,将这次升级的重点放在大规模强化学习和模型自我改进上。

系列核心包括 MiMo-V2.6-Pro 和 Flash 两个原生全模态模型,同时提供 Pro UltraSpeed 超高速模式,面向实时交互场景可提供最高 20 倍 推理速度。Pro 采用稀疏 MoE 架构,总参数量 1.02T、激活参数 42B;Flash 总参数量 309B、激活参数 15B,两者均支持文本、图像、视频和音频输入,以及 1M Token 上下文。

这次训练的核心变化是进一步扩大 Agentic RL 的规模。官方称,Flash 和 Pro 在不到 6 天内分别投入约 85 万美元 和 262 万美元 完成 30 步 强化学习训练,累计产生约 75 万条 轨迹;训练任务平均通过率分别提升约 25% 和 12%。

性能方面,小米 称 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 中取得 46 分,高于其列出的 Kimi K3 和 Qwen3.8 Max,并表示其在多项 Agent Benchmark 上接近 Claude Opus 5 和 GPT-5.6 Sol。

配套资源也同步开放:小米 开源 Pro、Flash 权重和技术报告,以及基于 Qwen3.5-9B 微调得到的 MiMo-V2.6-Distill-Qwen-9B,并发布 7K+ RL 任务环境、端到端 RL 训练框架和 mini-harnesses,供社区继续进行 Agentic RL 研究。

MiMo-V2.6 已接入桌面客户端和开放平台,API 价格沿用 V2.5;现有 mimo-v2.5-pro 和 mimo-v2.5 计划于北京时间 2026 年 10 月 21 日 10:00 下线。

相关链接:

2

SpaceXAI 推出 Grok 4.7 与 Fast 版本

xAI 发布 Grok 4.7,面向编程、Agent 和知识工作,该模型定价与前代不变,主要加强长任务执行、自我检查和长上下文管理。模型支持 50 万 token 上下文、文本和图片输入,以及 low 至 xhigh 四档推理强度。官方评测显示,其 CursorBench 4.0 xHigh 得分由 Grok 4.6 High 的 40.4% 提升至 46.3%,并同步升级安全防护。Grok 4.7 已上线API、Cursor、Grok Build等平台,另提供价格翻倍、输出速度更快的 Fast 版本,但仅限 Cursor 和 Grok Build。

SpaceXAI 发布 Grok 4.7,定位于编程、Agent 任务和知识工作。官方称,相比 Grok 4.6,新模型采用更大的基础模型,并在更困难、偏向多小时任务的数据上进行了更长时间的强化学习训练,重点提升长任务执行、自我检查和长上下文管理能力,同时引入新的安全防护体系;标准版价格和速度与 Grok 4.6 保持一致。

Grok 4.7 提供 50 万 token 上下文窗口,支持文本和图片输入、文本输出,文本输出不设固定上限,推理强度可选 low、medium、high 和 xhigh。API 价格在提示词低于 20 万 token 时为每百万 token 输入 2 美元、缓存输入 0.5 美元、输出 6 美元;超过 20 万 token 后分别为 4、1 和 12 美元。模型现已通过 API 提供,并进入 Cursor、Grok Build、OpenRouter、Vercel 和 Cloudflare。另有 Grok 4.7 Fast,以两倍 token 单价换取约两倍输出速度,目前仅在 Cursor 和 Grok Build 提供,不进入公开 API。

官方评测中,Grok 4.7 xHigh 在 CursorBench 4.0 得分 46.3%,高于 Grok 4.6 High 的 40.4%;DeepSWE v1.1 为 71.0%,EEBench 为 64.0%,AA Briefcase v1.1 为 1657,Terminal-Bench 4.0 为 38.0%,Harvey Legal Agent Benchmark 为 19.6%,HealthBench Professional 为 56.7%。SpaceXAI 还称,新模型在文档、演示文稿及专业知识工作任务上较 4.6 有所提升。

安全方面,SpaceXAI 称 Grok 4.7 使用全新的防护栈,在其拒绝与越狱抵抗测试中表现最好;在 HackerBench v0.3 中,仅有 3.3% 的高风险双重用途提示被放行,同时尽量减少对正常安全研究的误拒。SpaceXAI 还开始向部分网络安全合作伙伴提供邀请制的 Grok 4.7 红队能力,用于防御研究。

相关链接:

3

智谱开源ZCode并宣布完成安全整改

智谱开源ZCode并宣布完成安全整改,官方称最新版本移除了Repo Wiki入口及本地仓库快照上传链路,相关代码数据未留存。中国信通院与绿盟科技评估确认相关整改措施。开源仓库覆盖桌面应用到Agent CLI等,第一方代码采用Apache-2.0许可,但缺少原始提交记录,且关闭了issue和pull request功能。官方还注明开源版不享受GLM Coding Plan相关的额度活动权益。

此前,多名用户称 智谱AI 编程工具 ZCode 会在未获许可的情况下上传开发数据,智谱 随后将原因归于默认开启的代码库索引功能并道歉。

目前,智谱 已在 GitHub 公开 ZCode 源码。最新版移除 Repo Wiki 入口和本地仓库快照生成、上传链路,并称相关数据未被留存或用于模型训练。

中国信通院 与 绿盟科技 的评估确认了相关整改措施。

开源仓库覆盖桌面应用、浏览器工作台、后端服务、共享界面、Agent CLI 及运行时。第一方代码采用 Apache-2.0 许可,但不同运行形态的权限、存储和网络行为并不相同,也不保证包含官方产品的全部功能和活动政策。

该仓库目前没有原始提交记录,并关闭了创建 issue 和 pull request 的功能。

源码片段还显示,开源版不享受 GLM Coding Plan 相关的额度活动权益。

相关链接:

4

OpenAI称内部模型已解决逾百个数学开放问题

OpenAI称其8月28日开训的内部模型已解决纳维-斯托克斯千禧年难题及逾百个数学开放问题。针对学界对AI跳过过程批量产出结论的担忧,OpenAI正与独立数学顾问组合作,由其协助审查和传播新成果。

OpenAI称,其8月28日开始训练的一款内部模型已解决纳维-斯托克斯千禧年大奖难题,并解决数学多数领域超过100个长期未解的开放问题,进展速度令公司内部数学家意外。

面对数学界对以开放问题衡量AI能力的批评,OpenAI正与数学家建立的独立数学与人工智能顾问组合作,由该组协助评估新成果的重要性、传播方式和学术规范,并就数学研究及学习工具提供建议。

顾问组独立于OpenAI,成员不领取OpenAI报酬,可以主动提出和公开意见,但不负责建议OpenAI调整内部数学研究进度。

目前该模型仍为内部模型,OpenAI未说明公开可用时间,并表示仍在研究如何负责任地扩大数学AI能力的部署。

相关链接:

开发生态

5

硅基流动上线Xing4.0-29B-A4B并开放免费调用

硅基流动上线Xing4.0-29B-A4B模型并开放免费调用。该模型原生支持256K上下文,专攻复杂工程与长程Agent任务。

硅基流动上线中电信开源的Xing4.0-29B-A4B,并开放免费调用。

模型拥有29B总参数和4B激活参数,原生支持256K上下文、可扩展至512K,主要面向复杂工程、代码生成和长程Agent任务。

硅基流动称,模型基于国产算力与国产框架完成训练,并针对Claude Code等工具进行了适配。

相关链接:

产品应用

6

Gemini Notebook 开放 Interactive Learning Overviews

Gemini Notebook向所有用户开放Interactive Learning Overviews,该功能能把来源摘要与studio artifacts整合成交互式中心,方便一站式复习或了解新主题。同时,Live Chat已完成移动端Ultra用户全量推送,支持近百种语言实时语音对话。

Gemini Notebook 宣布 Interactive Learning Overviews 现已向所有用户开放,该功能位于 Reports 板块下,可将来源摘要与 studio artifacts 汇聚成一个交互式中心,用于复习或对新主题做一站式深入了解。

同日官方还宣布 Live Chat 已在移动端向全部 Ultra 用户完成 100% 推出,支持近 100 种语言的实时语音对话,由最新音频模型驱动,可就来源提问并获得分步指引。

相关链接:

技术与洞察

7

HeyGen发布Code2Video基准

HeyGen发布了Code2Video基准,用来评估LLM Agent将提示词转为动效代码的成片质量。基准涵盖168个提示词和16个模型,从构图、时序和制作质量等多个维度评分。

HeyGen 发布Code2Video Benchmark及配套的成对比较Judge模型,用于评估LLM Agent把提示词转化为动效代码后的成片质量。

该基准涵盖168个提示词和16个模型,从吸引力、提示意图、构图、时序及制作质量五个维度评分,并通过Judge模型比较同一提示词下的两段候选视频。

HeyGen称,Judge模型在1464个样本中与人类评价的一致率为82%,高于通用VLM的75%,单次比较延迟低于1秒。

排行榜已经公布,数据集已上线Kaggle;Judge模型的详细架构、训练和评估流程尚未公开,HeyGen表示将另行发布技术文章。

相关链接:

行业动态

8

OpenAI呼吁制定全球前沿AI技术标准

OpenAI发文呼吁制定全球前沿AI技术标准,重点覆盖自动化AI研究和递归自我改进RSI的风险管理,建立共同的能力评测和事件报告规范,应对各国规则碎片化等难题。

OpenAI提出,由美国牵头与各国制定全球前沿AI技术标准,重点覆盖模型能力评测、自动化AI研究和RSI的风险管理。

OpenAI认为,各国规则碎片化、集体行动难题和能力分布不均,可能妨碍跨境风险识别与应对。

具体可依托各国AI安全机构、CAISI、行业组织和标准机构,建立共同的能力测量、风险评估、人类监督及事件报告规范,适用于开放和闭源模型。

相关链接:

9

Qwen:用户保留Qwen-Image-2.1生成内容权利

Qwen Developers公开澄清Qwen-Image-2.1的许可问题:该模型采用的研究许可证约束的是模型权重、代码、文档等,商业使用模型需另行取得许可;用户用模型生成的图片等内容的权利由用户保留。

Qwen 澄清了 Qwen-Image-2.1 的许可范围:该模型采用的研究许可证约束的是模型权重、代码、文档等 Materials,这些材料目前仅限 非商业使用,商业使用模型需另行取得许可;用户用模型生成的图片等内容则不属于 Materials,相关权利由用户保留。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉和错误。

内容来自橘鸦 AI 早报,经作者同意转载阅读原文 ↗视频版哔哩哔哩YouTube