DECOHACK

Juya AI Daily · 橘鸦 AI 早报

AI 早报 2026-10-08

内容来自橘鸦 AI 早报,经作者同意转载阅读原文 ↗视频版哔哩哔哩YouTube
AI 早报 2026-10-08

今日概览 · 34 条

要闻

1

Anthropic 发布 Claude Haiku 5.5:平均成本降约 75%

Anthropic 发布 Claude Haiku 5.5,面向摘要、分类、实时客服、浏览器操作和编程子智能体等高吞吐、低延迟任务,支持可调 effort、自适应思考、100 万 token 上下文和 12.8 万 token 输出。10 万 token 内输入、输出价格降至每百万 token 0.10 和 0.50 美元,官方估算平均运行成本比 Haiku 4.5 低约 75%。

Anthropic 发布 Claude Haiku 5.5,定位高吞吐、成本敏感和低延迟任务,包括摘要、分类、数据库查询、实时客服、浏览器操作,以及作为 Opus 5.5、Sonnet 5.5 的编程子智能体。

它是首个支持可调 effort 的 Haiku 模型,默认启用自适应思考,上下文窗口提升至 100 万 token,最大输出 12.8 万 token。

官方评测中,OSWorld 2.1 离线子集由 Haiku 4.5 的 15.7% 升至 72.4%,Terminal-Bench 4.0 由 0% 升至 39.2%。

不过,新版 tokenizer 会使同一文本的 token 数较 Haiku 4.5 约增加 30%,开发者需要重新核算 token 和成本。

价格方面,10 万 token 以内的请求每百万 token 输入、输出分别为 0.10 和 0.50 美元,超过 10 万 token 后分别为 0.50 和 2.50 美元。

Anthropic 估算其平均运行成本比 Haiku 4.5 低约 75%。

Haiku 5.5 已在 Claude Platform、AWS、Google Cloud 和 Microsoft Azure 上提供。

相关链接:

2

OpenAI 向全员推送 GPT-6,上线智能交互界面

OpenAI 开始向 ChatGPT 用户推出 GPT-6 和 Intelligent UI,GPT-6 能边思考边回答,网页搜索场景下响应速度与质量均有提升。Plus 档位及以上订阅用户使用 GPT-6 Sol,Free 和 Go 订阅用户使用 GPT-6 Luna;本次更新仅覆盖 Chat,Work 和 Codex 模型不变。Intelligent UI 功能可按问题动态组合文本、图表、按钮、表单等交互界面,并直接生成计算器、小游戏等工具。

OpenAI 开始在 ChatGPT 推出 GPT-6 和 Intelligent UI。

GPT-6 支持一边继续思考、一边逐步给出回答。在 OpenAI 内部评测中,GPT-6 Extra High 开始回答所需时间与 GPT-5.6 Medium 相当,同时总体成绩高于 GPT-5.6 Extra High;涉及网页搜索时,GPT-6 Instant 平均比 GPT-5.6 Instant 提前 44% 开始回答。安全训练也针对网络攻击、生物威胁和暴力等高风险滥用进行了加强。

Intelligent UI 可根据问题动态组合文本、图片、图表、按钮、表单和交互组件,还能直接生成计算器、小游戏等任务工具;其界面采用可流式输出的原生组件和编译器,可随回答逐步生成,而不必等整段回复完成。

GPT-6 与 Intelligent UI 于 Plus、Pro、Business 和 Enterprise 用户当天率先在对话页获得更新,Free 和 Go 用户次日跟进。

付费套餐的 ChatGPT 使用 GPT-6 Sol,Free 和 Go 使用 GPT-6 Luna。此次更新仅适用于 ChatGPT 的 Chat 体验,Work 和 Codex 所用模型不随本次发布调整。

相关链接:

3

Codex 昨日按投票重置额度,今日再送手动重置次数

OpenAI Codex 负责人 Tibo 于昨日发起是否需要重置用量额度的投票,约四分之三的用户选择“需要重置”。随后他表示,已按投票结果执行重置。今日,他又宣布,Codex 和 ChatGPT Work 的活跃用户合计达到 4000 万。为此,所有付费账户将再获一次可以留着用的额度重置机会。

OpenAI Codex 负责人 Tibo 在 28 天更新活动第二天上线四项更新后,发起是否需要重置用量额度的投票,76% 的投票者选择重置。

他随后确认,已执行重置,四项改进也全部保留。

到了第三天,Tibo 称当天最大的更新是 GPT-6 登陆 Chat,Codex 和 ChatGPT Work 的活跃用户合计达到 4000 万 新高。

为庆祝这一进展,所有付费账户将再获一次可留待使用的额度重置机会,预计在太平洋时间当天结束前到账。

相关链接:

4

Claude Sonnet 5.5 缓存读取价格减半

Anthropic 宣布把 Claude Sonnet 5.5 的缓存读取价格降为一半。官方称,调整后这个模型在大多数长时间运行任务上的运行成本约降两成。

Anthropic 宣布把 Claude Sonnet 5.5 的缓存读取价格减半,降至每百万 tokens 0.10 美元。

官方估算,调整后 Sonnet 5.5 在大多数长时间运行任务上的运行成本降低约 20%。

相关链接:

5

Claude 为 Max 和 Team 订阅用户发放月度 API 额度

Anthropic 宣布向 Claude Max 和 Team 订阅用户按月发放 Claude Platform API 额度,供用户构建自己的应用和 Agent。其中 Max 5x 每月 100 美元,Max 20x 每月 200 美元,Team 方案按席位汇总、最高 500 美元,目前正在分批推出,无需为 Claude Platform 绑定支付方式。

Anthropic 开始向 Claude Max 和 Team 订阅用户按月发放 Claude Platform API 额度,正分批推出。

Max 5x 每月 100 美元,Max 20x 每月 200 美元。

Team 方案按席位汇总,标准席位每席 20 美元、高级席位每席 100 美元,合计上限 500 美元。

非营利组织和科学家折扣价 Team 方案适用相同标准。

额度可用于调用 Claude Platform 上的任意模型,覆盖 Claude API、Claude Managed Agents、Claude Agent SDK 和 playground。

但不适用于 Claude Code 和 Claude 应用内的超额使用,也不适用于 AWS、Bedrock 等云平台。

用户需将一个 Claude Console 组织关联到订阅方案后领取,无需为 Claude Platform 绑定支付方式。

额度按账单周期刷新、不结转。

Free、Pro 和 Enterprise 方案不在范围内。

相关链接:

6

谷歌 SynthID 检测网站面向全球用户开放

谷歌宣布 AI 生成内容检测工具 SynthID Detector 面向全球用户开放,此前该工具的早期版本仅提供给媒体专业人士。现在任何人都可以上传图片、视频或音频文件,检测其中是否带有谷歌或 OpenAI、英伟达、Kakao 等公司的隐形水印,苹果也即将加入。

谷歌宣布 AI 生成内容检测平台 SynthID Detector 面向全球用户开放,目前提供英文版本,此前其早期版本仅面向媒体专业人士。

用户上传图片、视频或音频文件后,可检测其中是否含有来自谷歌或 OpenAI、英伟达、Kakao 等合作方的 SynthID 隐形水印,苹果也即将加入支持。

谷歌称自 2023 年推出 SynthID 以来,已为超过 1800 亿张图片和视频、24 万年的音频内容添加水印,Search、Gemini 应用和 Chrome 中内置的验证功能目前每天处理超过 100 万次请求。

水印在添加滤镜等编辑后仍可识别,但该工具的检测结果并非 100% 准确。

相关链接:

开发生态

7

Claude Code 团队成员推出 html-plan skill,开放试用

Claude Code 团队成员 Thariq 开发了一个新 skill,让 Claude Code 生成更好的 HTML plan,页面里会用简洁语言展示方案、代码片段和待确认的问题。这个 skill 已经可以通过社区插件市场安装,他希望在正式大范围推出前先收集反馈。

Anthropic Claude Code 团队成员 Thariq 在 X 上宣布,他开发了一个让 Claude Code 生成更好的 HTML plan 的 skill,现已通过社区插件市场开放安装。

据其介绍,该 skill 生成的计划页用简洁语言描述方案,展示 代码片段,列出待澄清的问题,并制作 mockup;配套的 lint 机制用于减少 Claude 常见的失败情况,其中部分 lint 规则用于生成更好的图表和 流程图。

Thariq 表示特别喜欢调用栈展示和代码片段标注功能,前者借鉴了开发者 @dillon_mulroy 的做法。

用户可通过 claude plugin marketplace add anthropics/claude-plugins-community 添加市场,再用 claude plugin install html-plan@claude-community 安装。

Thariq 希望在大范围推出前先收集用户反馈,并表示想把它做成用 HTML 计划替代 Claude Code 默认计划模式的插件。

相关链接:

8

Claude SDK 内置 computer use 与 browser use 工具集

Anthropic 宣布把 computer use 和 browser use 工具集内置到了 Claude 的 Python 和 TypeScript SDK。

Anthropic 宣布,computer use 和 browser use 工具集现已内置到 Claude 的 Python 和 TypeScript SDK。

此前开发者需要自行编写循环、把点击和按键映射为命令。

现在这套循环改由 SDK 运行,并把动作发送给驱动。API 会告知开发者 Claude 想要点击或输入的内容。

开发者可以使用 browser_use、browserbase、e2b、daytonaio 的兼容驱动,也可以基于官方快速上手项目中的示例驱动自行编写。

相关链接:

9

OpenRouter 上线 ElevenLabs 全线语音模型,限时 5 折

OpenRouter 宣布 ElevenLabs 的语音模型正式上线其平台,开发者现在可以调用 9 个文字转语音模型和 2 个语音转文字模型。

OpenRouter 宣布 ElevenLabs 正式入驻其平台,一次性上线 9 个文字转语音模型和 2 个语音转文字模型。

语音合成最多支持 90 余种语言。开发者用现有的 OpenRouter API key 调用新增的音频接口即可,无需单独购买 ElevenLabs 订阅方案。

模型覆盖旁白、voice agent、实时对话和医疗转录等场景,其中 Scribe v2 提供说话人标签和词级时间戳。

所有 ElevenLabs 模型在 OpenRouter 列表价基础上 5 折,优惠持续到太平洋时间 10 月 19 日上午 8 点。

Realtime Scribe v2 的 WebSocket 实时版本不在本次上线范围内。

相关链接:

10

GitHub Copilot 开放本地沙箱,混合推理将于月底预览

GitHub Copilot 的本地沙箱正式开放,启用后可以限制它执行命令时访问的文件和网络。命令行版本也已支持发现本机安装的 Ollama 模型。官方还公布了自动判断任务该交给本地还是云端模型的混合推理功能,计划在十月晚些时候开启实验预览。

GitHub Copilot 本地沙箱正式可用,覆盖 CLI、Copilot 应用和 VS Code。

启用后,命令在隔离环境中执行,文件、网络和凭据等访问受策略约束。

CLI 从 1.0.94-0 版起,还可通过 /model 发现已安装的本机 Ollama 模型。

另一项更新是本地与云端混合推理:开发者可让 Auto 自动分配任务,也可手动选择本地模型,其中 HydraFusion 智能路由计划于 10 月晚些时候 开启实验预览。

配套的 MAI Code 1.1 Flash 设备端量化版体积为 53GB,支持 256K 上下文。

选择本地模型并不等于会话完全离线。

相关链接:

11

微软 MXC 正式可用,为 AI 智能体划定执行权限

微软的智能体执行容器 MXC 已在 Windows 11 正式可用。开发者可以先划定哪些文件能读写、哪些网络能连接,再让智能体在这个范围内运行代码和工具。Copilot、Codex 和 Replit 等已经接入。

微软宣布 Microsoft Execution Containers(MXC) 在 Windows 11 正式可用,为 AI 智能体提供受控的执行环境。

开发者和管理员可规定哪些文件能读写、哪些网络能连接,再由隔离环境执行这些规则,智能体不能自行扩大权限。MXC 提供跨平台 SDK,可接入 Windows、macOS 和 Linux 的不同隔离机制;GitHub Copilot、Codex、Replit 等已支持。

Windows 365 对 MXC 的支持也已正式可用,但通过 Entra 区分智能体与用户活动、部分 Intune 和 Agent 365 管理能力仍计划后续推出。

相关链接:

模型发布

12

Liquid AI 开源决策模型 d1-3B 和 d1-omni-600M

Liquid AI 开源了两款决策模型 d1-3B 和 d1-omni-600M。d1-3B 支持文本和图像输入,d1-omni-600M 为实验版本,支持文本加图像或文本加语音(英语),权重已在 Hugging Face 提供。

Liquid AI 开源 d1 决策模型家族 的两款模型 d1-3B 和 d1-omni-600M,权重已在 Hugging Face 提供。

d1-3B 支持文本和图像输入,在 Decision Index v0.2.1 上以 48.57 分居 10B 以下模型首位,超过参数量约 12 倍的 Decider 35B-A3B。

单问题延迟 在 RTX 4090 上为 8 毫秒,各所测边缘设备均不超过 50 毫秒。

d1-omni-600M 为 587M 的实验版本,支持文本加图像或文本加语音,同一请求只能携带其中一种。

其音频能力基于英语对话训练并截断在 30 秒。

两款模型可下载、微调并无限制部署,首日 支持 llama.cpp。

相关链接:

13

Perplexity 发布两款多模态嵌入模型

Perplexity 发布了 pplx-embed-v2-late 系列嵌入模型,共有 0.6B 和 9B 两个版本。两款模型共享同一个嵌入空间,可以直接检索文本、图像和页面,也能用小模型查询大模型建立的索引。

Perplexity 发布 pplx-embed-v2-late 系列,包含 0.6B 和 9B 两款多模态 late-interaction 嵌入模型,已在 Hugging Face 公开。两款模型基于 Qwen3.5 构建,为每个 token 输出一个 128 维向量并以 MaxSim 打分,可检索文本、图像和视觉文档,PDF、幻灯片和扫描件无需 OCR。

两模型从同一个内部 18B ColBERT 教师模型蒸馏而来,共享嵌入空间,9B 模型建立的索引可直接用 0.6B 模型查询。官方评测中,Q2D-Web 上 9B 模型 Recall@1000 达 74.8%,高于 nemotron-embed-8b 的 69.3%。

相关链接:

14

生数科技发布旗舰视频模型 Vidu Q4 Preview

生数科技旗下 AI 视频平台 Vidu 发布新一代旗舰模型的首个公开预览版 Q4 Preview,现已通过网页端和 API 平台开放使用。官方称同等预算最多可产出五倍的视频量。

生数科技旗下 AI 视频平台 Vidu 发布新一代旗舰模型的首个公开预览版 Q4 Preview,已通过网页端和 API 平台开放。

官方介绍,模型改进了角色表演、镜头衔接和视觉特效,最多支持 15 张图像参考与 3 段音频参考,输出分辨率覆盖 540p 到 4K,其中 2K 和 4K 支持 10-bit 色深。

上线促销价最低 0.014 美元每秒,官方称在可比输出规格和计费条件下,同等预算最多可产出 五倍的视频量。

Q4 Preview 先于完整版 Q4 模型发布,用户反馈将用于完善最终版本,最终定价与功能可能因订阅方案和地区而异。

相关链接:

产品应用

15

马斯克:Grok Bot 不再只用自家模型

马斯克在 X 平台发文宣布,SpaceXAI 的 Grok Bot 今后将按任务选用效果最好的后端模型,可以调用 Claude、Midjourney、Suno 等第三方模型。他还补充说,简单问题会交给小而快的模型处理,答案复杂的问题才会调用大模型。

马斯克在 X 平台发文宣布,SpaceXAI 旗下 Grok Bot 今后将按任务选用最好的后端模型,不再局限于自研的 Grok 系列,可调用 Claude Opus 5.5、Midjourney、Suno 等第三方 API,选择标准是"最有可能给用户最佳结果"。

他随后补充,简单问题将分配给小而快的模型,答案复杂的问题才交给大模型处理。

相关链接:

16

Grok Bot 0.68.1 发布:可制作幻灯片、发送格式化邮件

SpaceXAI 发布 Grok Bot 更新,Bot 现在可以和用户一起制作幻灯片,并交付为 PowerPoint 或 Google Slides 文件。本次更新还提升了它操作电脑的速度。

SpaceXAI 发布 Grok Bot 0.68.1 更新,Bot 现在可以和用户一起制作幻灯片、展示示例幻灯片供选择,并交付为 PowerPoint 文件或 Google Slides。

邮件方面,Bot 能从草稿卡片发送带标题、加粗和列表的格式化邮件,还可以搜索 Gmail 垃圾邮件文件夹并把邮件移回收件箱。

一对一聊天中,用户的消息会采用该 Bot 的颜色,该功能需 Grok Bot 0.64.0 或更高版本,可在设置中把强调色设为黑色关闭。

Bot 操作电脑的速度提升,所用屏幕分辨率从 1280×800 提高到 1920×1200。

相关链接:

17

Grok Bot 现可搜索和读取 X,全员免配置开放

Grok Bot 官方宣布,现在可以搜索、读取和持续监控 X 平台上的内容,不需要设置 X connector。官方举例,可以让它追踪产品的用户反馈、跟进突发新闻,或者每周汇总行业动态。

Grok Bot 官方宣布,Grok Bot 现在可以搜索、读取并监控 X 平台内容,官方列举的用法包括追踪产品用户反馈、跟进突发新闻和每周汇总行业动态。这一能力对所有用户开放,无需设置 X connector。

Grok Bot 团队成员 lauren 演示了配套工作流:让 Grok Bot 监控 X 上关于自己产品的用户反馈,把功能请求发到 issue tracker,bug 报告交给 Cursor cloud agent 或项目去分类和修复。

相关链接:

18

Grok 团队成员:X 平台 @bot 提及功能已上线

Grok Bot 团队成员表示,X 平台上线了 @bot 提及功能,回复任意帖子时加上 @bot 和一句指令,就能让 Grok Bot 帮忙处理。

SpaceXAI Grok Bot 团队成员 Larsen Cundric 表示,X 平台的 @bot 提及功能已上线。

用户在回复、帖子和引用中 @bot 并写下指令,例如加入 Notion 阅读清单、提醒日后阅读、总结帖子串或代拟回复,任务会直接进入用户的 Grok Bot。

使用前提是 X 账号绑定一个开通了 bots 的 grok.com 账号。

相关链接:

19

OpenAI 将为 ChatGPT for Teens 推出大学申请规划工具

OpenAI 公布了面向未满十八岁用户的 ChatGPT for Teens 的最新进展,并介绍即将上线的大学申请规划工具 College Planner。

OpenAI 公布了自动应用于未满 18 岁账户的 ChatGPT for Teens 的最新进展,并介绍即将上线的大学申请规划工具 College Planner:它把各校申请要求、截止日期、任务和助学金步骤整合为一份可持续更新的计划,初期面向美国十年级至十二年级、计划就读四年制大学的高中生,后续将扩展至更多国家和两年制大学、技术学院等。

新的学习工具也在加入:连续多页拍照合成 PDF 已上线 iOS、Android 版开发中,闪卡和更易创建的测验同步推出。OpenAI 称青少年平均每天使用不足 15 分钟,一周内近 120 万青少年使用过学习可视化功能,超过 18 万人使用过学习模式。

合作方面,OpenAI 将支持 College Advising Corps 扩展至新的州并设立 AI 奖学金项目,还将在未来 三 年支持波士顿儿童医院数字健康实验室的学生咨询委员会。

相关链接:

20

Codex Cloud 上线即支持 Tailscale

OpenAI 新推出的 Codex Cloud 内置了 Tailscale 支持,云端编程环境可以借此访问用户内网里的资源。Tailscale 表示两家公司并没有合作,他们是在产品上线之后才知道这件事。

OpenAI 新发布的 Codex Cloud 内置了 Tailscale 作为 VPN 选项,也是目前唯一支持的 VPN 提供方。云环境中的 Codex 借此可以访问用户 tailnet 内的内部 API、测试服务等资源。

Tailscale 表示双方没有合作协议或定制 API,OpenAI 直接用公开版 Tailscale 搭建了这一集成,Tailscale 团队在产品上线后才得知此事。

Codex Cloud 正逐步向付费 ChatGPT 订阅用户(Plus 及以上)开放。

该功能目前存在限制:仅支持 HTTP/HTTPS 目标,任意 TCP 需经 proxy:8088 转发,MagicDNS、split DNS、UDP、ICMP、入站连接和 SSH 均不支持。

相关链接:

21

Google推出实验性游戏生成平台Playground

Google 推出了实验性游戏平台 Playground,只要用文字描述想法,就能创建、游玩并分享自定义游戏,不需要任何编程基础。该平台已开放,创建权限将按 Google One 会员等级分批推出。

Google 推出实验性游戏平台 Playground,用户通过对话式界面输入文字描述,即可创建、游玩并分享自定义游戏,无需编程经验。

创建时可以从空白画布、改编起始提示或引导式支持入手,随时要求调整物理、规则、角色或环境,并即时试玩。平台基于浏览器,手机和电脑均可游玩社区游戏;作品可保持私密、生成链接分享,或发布到 Explore 画廊,部分类型支持游戏内排行榜和多人游戏,每款发布的游戏都会经过与社区准则一致的安全筛查。

Playground 现已面向美国 18 岁以上用户推出,创建权限按 Google One 会员等级分批开放;平台还将集成 Unity Spark,该功能目前处于测试阶段,封闭测试即将开始。

相关链接:

22

谷歌推出 AI Edge Foresight,Mac 端侧 AI 会议助手

谷歌为 Mac 推出了实验性会议助手应用 AI Edge Foresight,由 EmbeddingGemma 2 与 Gemma 4 端侧模型驱动。它能自动整理会议纪要并支持实时问答。

谷歌推出 Mac 版 AI Edge Foresight,这是一款实验性的本地 AI 会议助手应用,由 EmbeddingGemma 2 与 Gemma 4 端侧模型驱动。

应用调用 Mac 的麦克风和系统音频,把用户速记与实时会议内容结合,自动生成润色后的线上线下会议纪要,并与任意会议平台开箱即用。

它还支持用自然语言检索图片、文档、转写和笔记,并基于会议内容实时问答。

应用可完全离线运行,敏感数据不出设备,也无云订阅费用。据 IT之家 报道,该应用兼容 Apple 芯片 Mac,可免费下载。

相关链接:

23

DGX Station 将支持 Windows,可在本地运行万亿参数级模型

英伟达和微软展示了 Windows 版 DGX Station 桌面超算。它搭载 GB300 芯片,最高配备 748GB 统一内存,官方称可以在本地运行万亿参数级模型,也能供团队共享、同时运行多个智能体。相关设备计划今年晚些时候上市。

英伟达与微软展示 DGX Station for Windows,把桌面级 AI 超算带入 Windows 环境。

它搭载 GB300 Grace Blackwell Ultra Desktop Superchip,最高配备 748GB 统一内存,FP4 算力最高达 20 PFLOPS,官方称可在本地运行万亿参数级模型。

开发者和研究团队可直接在 Windows 中进行模型推理、微调和智能体开发,需要 Linux 工具链时仍可使用 WSL。

微软还将其定位为团队共享的推理设备,可支持 32 个或更多智能体同时运行。

相关设备计划 今年晚些时候 上市。

相关链接:

24

Surface Laptop Ultra 开启预售,2599 美元起

微软 的 Surface Laptop Ultra 开启预售,2599 美元起,十月十六日上市。它搭载 英伟达 RTX Spark 芯片,最高配备 128GB 统一内存,官方称能在本地运行超过 一千二百亿 参数的模型。同期面向开发者的桌面设备 Dev Box 售价 5999 美元,计划 十一月 在美国发货。

微软 开放 Surface Laptop Ultra 和 Surface RTX Spark Dev Box 预售,两款设备均搭载 NVIDIA RTX Spark,最高配备 128GB 统一内存,官方称可在本地运行超过 1200 亿 参数的模型。

Surface Laptop Ultra 配备 15 英寸 触控屏,支持磁吸 USB-C 充电,售价 2599 美元 起,10 月 16 日 上市。

面向开发者的桌面设备 Dev Box 售价 5999 美元,预装多种开发工具,计划 11 月 在美国发货。

本轮进展是开放预售,产品此前已经公布。

相关链接:

25

Windows 上的 Copilot 将能读取本地上下文并代办电脑任务

微软准备升级 Windows 上的 Copilot。经过用户许可,它将能读取文件和近期活动,帮忙整理文件、排查设备问题,也能调用本机模型处理任务。这些功能预计未来几个月在 Copilot+ PC 上逐步推出。

微软宣布为 Windows 上的 Copilot 增加三类本地能力:

经用户许可读取文件和近期活动;代为整理文件、排查设备问题等;以及调用电脑上的模型并按需结合云端能力。

更新覆盖 Home、Code 和 Autopilot: Home 可利用正在处理的文件;Code 可协助创建 Windows 应用;Autopilot 则可结合本地信息持续处理任务。

相关功能预计未来几个月在 Copilot+ PC 上逐步推出,需要 Windows 更新。具体时间和可用范围因设备、市场及芯片平台而异。

相关链接:

技术与洞察

26

像对同事说话:Claude Code成员谈提示词心得

Claude Code 团队成员分享了他使用 Claude 的方式:像和同事说话一样直接沟通,说清目标就可以,不需要精心设计的提示词。他表示,现在更重要的是告诉模型要做什么、希望它投入多少精力,以及如何验证结果。

Anthropic Claude Code 团队成员 Boris Cherny 分享了他提示 Claude 的方式:像对同事一样交流,提示没有秘诀,多数任务不必写得过度结构化或面面俱到,给 Claude 一个目标,它会自己解决。

他表示,在 Sonnet 3.5 时代提示词的写法影响很大,如今更重要的是向模型讲清三点:要做什么、投入多少精力,以及如何验证自己做对了。

他引用自己此前的实践作为例子:用 Opus 5.5 以 Lean 形式化验证 Claude Agent SDK,几条简短提示产出 16 个修复 bug 和竞态条件的 PR。

他在回复中还表示,自己不使用自定义 CLAUDE.md,对 Opus 5.5 默认使用 medium 推理强度。

相关链接:

27

Artificial Analysis 发布音乐模型评测榜单

Artificial Analysis 推出了音乐生成模型的评测榜单,用盲测投票的方式给各家模型打分,榜单分成纯音乐和带人声两类,分别单独排名。并支持按曲风查看细分排名。

benchmark 机构 Artificial Analysis 发布音乐生成模型评测方法论,正式上线音乐生成榜单。评测通过人工偏好盲测投票进行,受邀评委在 Music Arena 中盲听同一 prompt 生成的两段曲目并选出更偏好的一段,投票需在听完每段至少 10 秒后才能进行,模型名称在投票前完全隐藏。

榜单分为 AA-Music-Instrumental v1.1 和 AA-Music-Vocal v1.1 两个 benchmark,前者评测无人声的纯音乐生成,后者评测含歌唱或口语人声的音乐生成,且要求模型能自行根据 prompt 生成歌词和人声。评分采用 Bradley-Terry 最大似然估计换算为 Elo 分数并附带 95% 置信区间,另按 Pop、Hip-Hop 等曲风提供细分排名。

相关链接:

28

Unsloth:本地4GB显存训练Decision模型

Unsloth 宣布,利用 Unsloth,只需 4GB 显存就能在本地把 Qwen、Gemma 等 LLM 微调成 Decision model。

Unsloth 宣布,现在可以在本地用其开源仓库训练自己的 Decision model,通过 Clef head 微调把 Qwen3.8、Gemma 4 等 LLM 转换为 Decision model。

官方称 Qwen3.5 0.8B 经此微调后,在 3 个决策基准上的综合准确率从 20.7% 提升到 74.3%,训练只需 4GB 显存。

微调使用 LoRA(r=64)训练一个 epoch,下游准确率从 30–37% 提升到 78%。

Unsloth 团队的 Daniel Han 补充称,Qwen、Gemma、Llama 均已转换为 Decision model,最低 3GB 显存即可完成训练。

用户可通过 Unsloth Desktop 试用。

相关链接:

行业动态

29

韩国宣布 35 亿美元前沿 AI 项目,对标中国开源模型

韩国政府宣布,将于明年启动国家级前沿 AI 研发项目,计划投入约 35 亿美元的政府股权投资,开发能与中国领先的开源模型竞争的韩国国产前沿模型。

韩国政府宣布 明年 启动国家支持的 前沿 AI 项目,计划以 4.7 万亿韩元(约 34.8 亿美元)的政府股权投资,开发能与中国领先开源模型竞争的韩国国产 前沿模型,规模约为此前向五家企业承诺的 5300 亿韩元的九倍。

这笔资金将计入 明年预算案,据媒体报道仍需议会批准。

投资预计包括 3.9 万亿韩元 购置 1 万块 Nvidia Vera Rubin GPU、8000 亿韩元 购买训练数据,参与企业需匹配相应民间资金。

政府将通过公开申请和评审遴选参与企业,并考虑设立特殊目的公司承载投资,使回报与公众共享。

正在进行的 国家基础模型项目 竞赛照常推进,但转向 行业专用模型,年底 选出的两支决赛队伍可选择加入 前沿 AI 项目 或专注 行业应用。

相关链接:

30

Biohub 联合美国能源部、NIH 投 18 亿美元扩建 AI 生物数据计划

研究机构 Biohub 联合美国能源部、美国国立卫生研究院,以及 Google DeepMind、Meta 等公司,合计投入 18 亿美元,建设可用于训练 AI 的开放生物数据,帮助研究者构建能预测细胞如何响应干预的模型,加速疾病防治研究。

Biohub 联合 美国能源部、美国国立卫生研究院 以及 Google DeepMind、Isomorphic Labs、Meta 宣布扩展 Virtual Biology Initiative,各方合计投入 18 亿美元 的资金、数据、算力和新测量技术,用于生成面向 AI 的开放生物数据,官方称这是迄今最大规模的 AI-ready 生物数据协同投入。

其中 美国能源部 五年内投入超过 5 亿美元 开展细胞基础研究。

NIH 将协调此前超过 5 亿美元 联邦投资形成的数据集并与 Biohub 一起将其标准化用于 AI 训练。

Google DeepMind、Isomorphic Labs 和 Meta 合计投入 3 亿美元。

该计划此前已由 Biohub 以 5 亿美元 创始投入启动,Allen Institute、Human Cell Atlas 等机构和 NVIDIA 也将参与,目标是构建能在数字层面预测细胞响应的生物模型,加速疾病的预防和治疗研究。

相关链接:

31

Google 与 Constellation Energy 签订20年核电采购协议

Google 与 Constellation Energy 签订了长期核电采购协议,将通过升级现有核电机组增加供电能力。这批新增容量尚未交付,首项扩容预计在 2028 年完成。

Google 与 Constellation Energy 签订了为期 20 年的购电协议,将通过升级现有核电机组,为 PJM 电网新增 890 MW 核电容量。Constellation 将投入超过 43 亿美元,升级 11 台核电机组,首项扩容预计在 2028 年完成。

双方还签订了为期 15 年、涉及 2,700 MW 的供能协议;据路透社援引 Google 的说明,这部分供应不绑定特定发电来源。协议纳入需求响应机制,在电网承压时削减非关键用电。

双方同时扩大为期五年的技术合作,Constellation 将采用 Google Cloud 和 Gemini Enterprise,用于容量交付、发电调度和关键基础设施保护。

相关链接:

32

Nous Research获9000万美元B轮融资

Hermes Agent开发商 Nous Research 完成 9000 万美元 B 轮 融资,公司估值达到 15 亿美元。官方表示,将用这笔资金把开源的 Hermes Agent 推向企业客户,并开发移动应用。

据 《华尔街日报》 报道,开源 AI Agent 开发商 Nous Research 完成 9000 万美元 B 轮融资,估值 15 亿美元,NVIDIA、微软 M12、三星、Y Combinator 和 Menlo Ventures 等参投。

公司表示将用这笔资金打造面向企业的 Hermes for Businesses,并开发移动应用。

官方数据显示,Hermes Agent 已被克隆超过 2400 万 次,按内部估算约占全球 token 用量的 2.5%。

相关链接:

前瞻与传闻

33

据报道 SpaceX 洽借 400 亿美元采购 Nvidia 芯片

据报道,马斯克旗下的 SpaceX 正在与银行和投资者洽谈,拟举债 400 亿美元采购 Nvidia 芯片。知情人士称,相关谈判尚处早期阶段,可能最终无法达成交易。

据彭博援引知情人士报道,马斯克旗下的 SpaceX 正与银行和投资者洽谈,拟举债 400 亿美元采购 Nvidia 芯片,若达成将是 AI 算力建设领域有史以来规模最大的债务融资之一。

英国《金融时报》此前报道称,这笔融资包括约 100 亿美元银行贷款和约 300 亿美元投资级债券,由 Apollo Global Management 领衔,预计 2027 年完成。

太平洋投资管理公司(PIMCO)是正在评估该交易的投资管理机构之一。知情人士称,谈判仍处早期阶段,可能不会达成交易。

相关链接:

其他

34

16岁少年照 Claude 指引下山被困,获救援队救出

据报道,加拿大一名十六岁少年依照 Claude 提供的下山路线指引离开步道,被困在一处陡峭岩壁下方,随后由救援队救出。当地救援队提醒公众不要依赖 Claude 等聊天机器人获取野外路线信息。

据 CTV News 报道,加拿大不列颠哥伦比亚省一名 16 岁少年乘缆车登上超过 4000 英尺的 Grouse Mountain 山顶,下山途中被 Anthropic 的 Claude 聊天机器人带离步道,被困在 Crown Mountain 一处绰号“Widowmaker”的陡峭岩壁下后拨打电话求救。

North Shore Rescue 搜救经理 Paul Markey 表示,一旦坠落可能造成重伤甚至死亡。因岩壁陡峭垂直、直升机无法靠近,两名救援者绳降设锚,将少年转移至可吊运位置后救出。

Markey 还提醒公众不要依赖 Claude 等聊天机器人获取此类信息,应自行研究路线并辅以训练和导航。

相关链接:


提示:内容由AI辅助创作,可能存在幻觉和错误。