DECOHACK

Juya AI Daily · 橘鸦 AI 早报

AI 早报 2026-07-09

要闻

1

SpaceXAI 正式发布 Grok 4.5 模型

SpaceXAI 正式发布 Grok 4.5 模型,该模型与 Cursor 联合训练,面向编程、agentic tasks 及知识工作,具备500k上下文窗口、80 TPS 推理速度及两倍于同类领先模型的 token 效率。在第三方评测中表现优异,Elon Musk 称其内部评估大致与 Opus 4.7 相当。目前该模型已在 Grok Build、Cursor 及 API 上线。

SpaceXAI 发布 Grok 4.5 模型。

该模型采用 MoE 架构并由 SpaceXAI 与 Cursor 联合训练。

它具备 500k 上下文窗口、80 TPS 推理速度及官方称两倍于同类领先模型的 token 效率。

根据官方及第三方数据,Grok 4.5 在 DeepSWE 1.0 及部分代码基准中得分位于前列。

Elon Musk 称其内部评估大致与 Opus 4.7 相当且速度更快,并预计其上下文窗口下周将升级至 1M。

基础模型定价为每百万输入 token 2 美元、输出 6 美元。

目前用户可通过 Grok Build、Cursor 及 SpaceXAI 控制台使用。

同时,Cursor 指出该模型在 CursorBench 的分数因数据污染已被排除。

相关链接:

2

字节跳动发布 Seedream 5.0 Pro

字节Seed发布多模态图像生成模型Seedream 5.0 Pro。该模型强化了图文匹配与文字渲染,支持复杂信息可视化与真实影像质感还原,原生支持十余种语言输入并自动适配排版,还能通过图层分离与色彩材质替换实现交互式精准局部编辑。模型现已上线火山方舟,将陆续登录豆包与即梦。

字节跳动 Seed 官方发布多模态图像生成模型 Seedream 5.0 Pro,全面提升图文匹配、结构合理性与文字渲染基础能力。

该模型具备复杂信息可视化、交互式精准编辑、真实影像质感与原生十余种多语种输入生成四大核心能力,支持图层分离、色彩与材质替换等操作。

目前模型已上线 火山方舟 体验中心,将陆续登录 豆包 与 即梦 平台。

官方称其在更细粒度文字渲染与像素级编辑保持上仍有进步空间。

相关链接:

3

OpenAI 发布 GPT-Live 系列全双工语音模型

OpenAI发布新一代全双工语音模型系列 GPT-Live-1,支持同时听说,并可将复杂推理、搜索及 Agent 任务异步委托给 GPT-5.5。该模型正逐步向 ChatGPT 全球用户推送,付费默认用 GPT-Live-1,免费用 mini版,API即将开放。

OpenAI 发布新一代语音模型 GPT-Live,包含 GPT-Live-1 与 GPT-Live-1 mini 两个版本。

其采用全双工架构,可实现同时听与说。

该模型支持将复杂推理与搜索任务异步委托给 GPT-5.5 处理。

两款模型正逐步向 ChatGPT 全球用户推送。

付费用户将默认使用 GPT-Live-1,免费用户将默认使用 GPT-Live-1 mini。

开发者与企业可注册获取 API 通知。

该模型目前不支持视频与屏幕共享。

且在部分语言中存在口音与流利度局限。

相关链接:

4

Cognition 发布 SWE-1.7 模型

Cognition 发布 SWE-1.7 模型,官方称其基于 Kimi K2.7 基座通过 RL 训练实现了接近前沿模型的性能,目前已在 Devin 平台可用且通过 Cerebras 提供 1000 TPS 速度。

Cognition 发布 SWE-1.7 模型,官方称其为该实验室目前训练的最强模型。

它基于 Kimi K2.7 基座并进行了大量 RL 训练。

官方称,SWE-1.7 在其推出的基准测试 FrontierCode 1.1 Main 上得分为 42.3%。

其表现接近 GPT-5.5 和 Claude Opus 4.8 等前沿模型,且成本更低。

该模型在 Terminal-Bench 2.1 和 SWE-Bench Multilingual 上也表现靠前。

该模型现已在 Devin 的 Web、Desktop 和 CLI 端可用。

下个月 对付费用户免费。

SWE-1.7 Lightning 版本由 Cerebras 提供 1000 TPS 速度。

相关链接:

5

OpenAI 确认 GPT-5.6 Sol 将于周四公开发布,获美国政府批准

OpenAI宣布其最新模型系列 GPT-5.6 将于当地时间本周四公开发布,并已开始在全球范围内扩大预览访问。据媒体报道,此次全面发布已获得美国商务部的批准,此前该模型因政府要求进行了附加安全测试,而其初期发布仅限于受审查的合作伙伴。

据 OpenAI 官方消息,GPT-5.6 Sol 以及更低级别的模型 Terra 和 Luna 将于 本周四 正式公开发布。

目前预览访问权限正在全球范围内扩大。

美国科技媒体 Axios 援引知情人士称,美国商务部 在完成附加测试后,已为 GPT-5.6 的广泛发布开了绿灯。

部分提前体验者认为,尽管 Sol 本身相比前代是一次巨大飞跃,但相较于竞争对手的 Fable 模型,其在多数任务上的表现仍有差距。

不过其在 Agent 能力和稳定性上有显著提升。

相关链接:

开发生态

6

Google AI Studio 支持导入 GitHub 仓库并同步

Google AI Studio 推出 "import from GitHub" 功能,可将 GitHub 仓库自动转换为兼容其运行时的格式,并支持将项目同步回 GitHub。

Google AI Studio 正式推出 "import from GitHub" 功能。

该功能可将 GitHub 仓库自动转换为兼容 Google AI Studio 运行时的格式。

用户可在 AI Studio 内继续迭代项目、添加功能或部署,并支持将项目同步回 GitHub。

操作时,用户需进入 AI Studio Build 界面点击 "+" 选择 "Import from Github"。

相关链接:

7

Cloudflare 推出 Drop 文件夹拖拽部署服务,无需账号

Cloudflare 推出了一项名为 Drop 的实验性部署服务,用户可将文件夹拖拽至浏览器即可将网站即时部署到 Cloudflare 全球网络。该服务无需注册账户,但部署的站点默认在 60 分钟后过期,除非用户进行认领。

Cloudflare 正式推出了名为 Cloudflare Drop 的快速部署服务。

用户只需将包含网站文件的文件夹直接拖拽到 https://www.cloudflare.com/drop/ 网页中,就能立即获得一个由 Cloudflare 全球网络分发的可访问站点。

该功能的实现得益于其底层与 Wrangler 开发工具的集成。官方称在一个月前发布的 Wrangler 更新中就已包含此能力,使得 Agent 也能通过该工具实现站点部署。

相关链接:

模型发布

8

Mistral AI 发布 Robostral Navigate 模型

Mistral AI发布了 8B 参数的具身导航模型 Robostral Navigate。官方称其只需自然语言指令与单颗RGB摄像头,无需深度传感器或LiDAR,就能控制轮式、足式及飞行机器人自主导航。

Mistral AI 发布了其首款具身导航模型 Robostral Navigate,该模型参数量为 8B。

模型接收自然语言指令与单颗 RGB 摄像头画面,无需深度传感器或 LiDAR 即可驱动机器人在复杂环境中自主导航。

并在 R2R-CE 未见环境基准中取得 76.6% 的成功率。

该模型可运行于轮式、足式及飞行机器人,支持跨机器人尺寸与摄像头内参泛化。

目前官方仅提供团队联系渠道。

相关链接:

9

蚂蚁灵波开源具身智能视频模型LingBot-Video

Robbyant开源首个具身智能MoE视频模型LingBot-Video,总参30B推理仅激活3B,效率提升约3倍满足机器人实时需求。引入7万小时具身数据优化物理合理性,已开源全套权重与代码。

Robbyant发布并开源了首个专为具身智能设计的大规模MoE视频生成模型LingBot-Video,采用DiT加MoE架构,总参数30B但推理时仅激活3B,实现了约3倍于稠密模型的推理效率以满足机器人实时需求。

该模型在大规模互联网视频预训练基础上叠加了超过7万小时的具身数据,并引入多奖励系统优化高美学、物理合理性与任务完成度。

官方数据显示,LingBot-Video在RBench基准测试中以0.620的得分排名第一,超越了Wan2.6、Seedance 1.5 pro、Cosmos3 Super和Veo 3等模型。

项目现已基于Apache 2.0协议开源,提供了包含Dense(1.3B)、MoE(30B-A3B)及基于Qwen3.6-27B的重写器在内的完整模型权重与代码。

相关链接:

10

蚂蚁灵波发布开源交互式世界模型 LingBot-World 2.0

Robbyant 发布开源世界模型 LingBot-World 2.0,支持小时级无视觉偏移实时交互及 Agent 驱动,14B 权重已上线且仅限非商业用途。

蚂蚁灵波科技发布并开源了交互式世界模型 LingBot-World 2.0。

该模型通过因果预训练和少步蒸馏技术实现了小时级无视觉偏移的长时间生成。

它支持 720p/60fps 实时流与亚秒级控制延迟。

该模型还引入了包含 Pilot Agent 与 Director Agent 的 Agentic Harness 机制,以支持攻防施法等多样交互与事件演化。

目前 14B 的 causal-fast 模型权重和推理代码已在 HuggingFace 等平台开放。

其采用 CC BY-NC-SA 4.0 许可协议,仅限非商业使用。

用户可通过 Reactor 或 LingGuang 体验实时版本。

但官方明确该版本缺失部分功能,完整能力 Demo 将在 WAIC 2026 提供。

且模型在长期记忆与物理理解上仍有局限。

相关链接:

11

SenseNova 发布统一视觉任务多模态模型 SenseNova-Vision

SenseNova团队发布**SenseNova-Vision-7B-MoT**模型权重。该模型采用统一多模态生成范式,无需专属预测头即可将视觉任务转为文本或图文混合生成,覆盖理解与几何预测等任务。

SenseNova团队发布了SenseNova-Vision-7B-MoT模型权重、SenseNova-Vision-Corpus-50M数据集、推理代码及技术报告。

该模型将计算机视觉任务统一建模为文本、图像或图文混合生成,无需专属预测头即可覆盖结构化理解、几何预测、分割及多视图重建。

模型权重基于CC BY-NC 4.0许可发布,仅限非商业用途。官方称其在多项基准评测指标上超越或持平对比模型。

官方同时指出该模型非单项最优、输出解析依赖特定规则且对提示词敏感,稠密几何预测精度需独立校验。

相关链接:

技术与洞察

12

OpenAI 称 SWE-Bench Pro 约 30% 任务存缺陷

OpenAI官方审计SWE-Bench Pro编程基准,发现约30% 任务因隐藏要求或测试过于严格等原因存在缺陷,正式撤回对该基准的推荐。

OpenAI官方发布审计报告指出,广泛使用的AI编程基准 SWE-Bench Pro 已无法可靠衡量前沿编程能力。

该机构依据基于**GPT-4模型的研究Agent** 与五名独立软件工程师的审查结果估计,约30% 的测试任务存在缺陷。

这导致正确解决方案因隐藏要求、过于严格的测试等原因失败。

OpenAI 已撤回此前建议研究社区采用 SWE-Bench Pro 作为主要编程评估的推荐。

并呼吁开发更难、更公平且更值得信赖的新基准。

相关链接:

13

JetBrains发布Kotlin Benchmark评估AI编程Agent

JetBrains发布Kotlin Benchmark,用于评估AI编程Agent在Kotlin任务上的表现。该基准包含105项开源工程任务,并已上线公开排行榜。

JetBrains 发布官方 Kotlin Benchmark,用于评估 AI 编程 Agent 在真实 Kotlin 软件工程任务上的表现。

该基准基于 SWE-bench 方法论,包含 105 项开源工程任务。

它要求 Agent 解析问题并生成通过容器化环境验证的补丁。

在首次评估中,Claude Code with Opus 4.7 xhigh 解决率居首。

基准资产与排行榜均已公开,但结果尚未包含最新模型。

相关链接:

14

Android Developers 更新 Android Bench 基准

Android Developers 更新 Android Bench 基准测试,升级采用 Harbor Framework,官方数据显示 Claude Fable 5 以 84.5% 的得分位居榜首。

Android Developers 宣布更新了专注于 Android 开发特定挑战的 Android Bench 基准测试。

该测试升级了评估方法,采用 Harbor Framework 进行现实 AI 推理测试,并开放社区在 Harbor Hub 提交开发任务和分享评估。

根据官方排行榜,Claude Fable 5 以 84.5% 的得分排名第一,GPT 5.5 和 Claude Sonnet 5 分列二三位。

Google for Developers 称此次新增了 8 款模型。

相关链接:

15

Claude Code 新增 /checkup:去重配置文件、关闭慢速 hooks 等

Claude Code 工作人员介绍了近日上线的 /checkup 命令,可自动清理未使用的 skills、MCP 和插件,并对本地配置文件去重,修改前都会征求用户同意。

Claude Code 工作人员 @bcherny 发帖介绍称,Claude Code 新增 /checkup 命令,旨在帮助用户自动完成开发环境的清理与优化工作。

运行该命令后,系统会检测并移除不再使用的 skills、MCP 及 plugins 以节省上下文;将本地 CLAUDE.md 与代码库中的版本进行去重;把根目录下的 CLAUDE.md 拆分为嵌套子文件或独立的 skills;关闭执行速度较慢的 hooks。

同时,将 Claude Code 更新到最新版本;默认启用 auto mode;并预批准之前常被用户拒绝的只读命令。

该命令在应用任何更改前都会与用户确认,确保不会意外修改配置。

相关链接:

行业动态

16

OpenClaw 成立非营利基金会

OpenClaw 官方宣布成立非营利组织 OpenClaw Foundation,致力于保持项目开源独立,现已组建全职团队并与 OpenAI 及 NVIDIA 等建立合作。

OpenClaw 官方宣布正式成立 501(c)(3) 非营利组织 OpenClaw Foundation,以保护该项目保持 MIT 许可证、开源和独立。

该基金会旨在为 Agent 提供中立基础并推广个人 AI,目前已组建开源维护者全职团队,并由项目负责人 Peter 继续主导技术决策。

官方称该项目目前每周新增 450 万个 claw,并已与 OpenAI、NVIDIA、Microsoft 及密歇根大学等超过 30 家机构建立合作或接受捐赠。

合作方已分别推出了基于 OpenClaw 的 NemoClaw 与 Microsoft Scout 等产品,并向上游贡献了安全及部署相关的技术与资金。

相关链接:

17

Prime Intellect 获投 1.3 亿美元估值达 10 亿美元

Prime Intellect 宣布完成 1.3 亿美元 A 轮融资,由 Radical Ventures 领投。该公司推出 Open Superintelligence Stack,提供模块化训练、推理与计算。

Prime Intellect 已完成 1.3 亿美元 的 A 轮融资。 据 TechCrunch 报道,其估值已达到 10 亿美元。

此轮融资由 Radical Ventures 领投。 参投方包括 NVIDIA Ventures、Intel Capital 及 Dell Technologies Capital 等。

该公司推出了 Open Superintelligence Stack。 该平台整合了包含 prime-rl 在内的强化学习训练、推理及计算资源。 它以模块化方式供客户构建自有的 AI Agent。

官方称,该平台已服务超 6000 家 客户。 其年化收入已超 1亿美元。

相关链接:

前瞻与传闻

18

消息称MiniMax计划推出2.7万亿参数大模型

据媒体报道,MiniMax 计划推出2.7万亿参数的新一代大语言模型,内部代号M3 Pro,预计最早于今年第三季度发布并计划开源。

据媒体报道,MiniMax 正在开发一款 2.7万亿 参数的新一代大语言模型。

该模型内部代号为 M3 Pro,参数规模远超其目前 4280亿 参数的旗舰模型 M3,官方发布时是否保留该名称尚不确定。

据报道,该模型最早可能于 今年第三季度 发布,MiniMax 计划将其开源。

消息称其规模和能力将超越目前市面上的国产 AI 大模型。

相关链接:

19

Perplexity 研发内部 AI 编程工具 Teammate

据媒体报道,Perplexity 开发内部 AI 编程工具 Teammate,自 5月 供工程师使用,未来或对外推出,上线时间未定。

据 Business Insider 报道,知情人士透露 Perplexity 已开发一款内部 AI 编程工具。

内部代号为 Teammate,自 5 月起供公司工程师使用。

该工具旨在全程统筹软件项目全流程工作,支持多模型兼容。

目前尚不确定是否会对外推出及具体上线时间。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉和错误。

内容来自橘鸦 AI 早报,经作者同意转载阅读原文 ↗视频版哔哩哔哩YouTube