公众号正文需在微信内阅读,站内仅提供摘要。
AI 日报 · 2026年07月02日
2026年07月02日日报
本期共 22 条 AI 资讯,涵盖实用技巧 10 条、行业资讯 7 条、项目推荐 5 条。推荐关注:美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型;NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型;xAI 发布 Voice Agent Builder 测试版。
美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型
精选理由
国产算力上首个全流程自训的万亿开源模型,1M上下文和动态专家架构直指Agentic Coding场景,OpenRouter调用量已经冲到前三,不是Demo是生产力。
AI 摘要
正文
NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型
精选理由
NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。
AI 摘要
正文
NVIDIA 发布了 Nemotron-Labs-TwoTower,这是一个基于预训练自回归骨干网络构建的扩散语言模型。该模型以开放权重形式发布,遵循 NVIDIA Nemotron 开放模型许可协议。此次发布旨在解决文本生成中的吞吐量瓶颈问题。
自回归(AR)模型每次解码一个 token。这种串行过程限制了生成吞吐量。离散扩散语言模型则另辟蹊径。它们并行生成 token,并逐步迭代优化。
大多数扩散语言模型使用一个网络承担两项任务。它在每一步既表示干净 token,又对加噪 token 进行去噪。TwoTower 将这些任务分离到两个塔中。它保持了 AR 基线模型综合基准质量的 98.7%。同时,其实际生成吞吐量提升了 2.42 倍。
太长不看版
TwoTower 将扩散过程拆分为一个冻结的 AR 上下文塔和一个经过训练的去噪器塔。
它以 2.42 倍的吞吐量(γ=0.8,S=16,2×H100)保留了 AR 质量的 98.7%。
去噪器在约 2.1T token 上训练;骨干网络使用了 25T token。
一个检查点支持扩散、模拟 AR 和 AR 解码三种模式。
Nemotron-Labs-TwoTower
TwoTower 是一种逐块自回归扩散模型。它基于 Nemotron-3-Nano-30B-A3B 实现,这是一个开放权重的混合骨干网络。该骨干网络交错使用了 Mamba-2、自注意力机制和混合专家(MoE)层。
每个塔有 52 层:23 层 Mamba-2、6 层自注意力、23 层 MoE。发布的检查点包含两个塔,总参数量约 600 亿。每个塔每 token 的活跃参数约 30 亿。MoE 使用 128 个可路由专家,其中 6 个激活,外加 2 个共享专家。
两个塔初始时均为同一骨干网络检查点的副本。仅训练去噪器塔,AR 上下文塔保持冻结。去噪器在约 2.1T token 上训练,而骨干网络的预训练数据量为 25T token。
两个塔如何工作
AR 上下文塔对提示词和已确定的 token 进行因果计算。它生成每层的 KV cache 和最终的 Mamba-2 状态,从而保留骨干网络的自回归能力。
扩散去噪器塔对噪声块进行优化。在块内部,它使用块内双向注意力。对于过去的干净块,它保持因果性。
这些塔逐层连接。去噪器层 i 对上下文塔层 i 进行交叉注意力。这种逐层对齐的交叉注意力使得能够多尺度地访问主干网络的表示。此前的方法仅广播最后一个隐藏状态。
另外两项去噪器的修改也很重要。Mamba-2 层从其初始状态源自上下文塔的 Mamba 状态。扩散时间步通过 adaLN-single 时间调节来调制每一层。这个 adaLN 模块只增加了约 150 万个参数。
生成是逐块进行的。每个块从 S 个 [MASK] 模型 token 开始。去噪器经过 T 步对其进行细化,然后确定该块。之后,上下文塔处理已确定的块以更新其缓存。
这解释了为什么多次去噪步骤仍然可以胜过单模型 token 解码。自回归解码每一步仅确定一个模型 token。TwoTower 在细化的早期阶段每步确定多个模型 token。
基准测试
评估在 2×H100 GPU 上使用 BF16 精度进行。默认运行点为置信度解掩码,阈值 γ=0.8,块大小 S=16。该表格将 AR 基线方法与 TwoTower 扩散解码进行了比较。
任务Nemotron-3-Nano-30B-A3B(自回归)Nemotron-Labs-TwoTower(扩散)
MMLU(5-shot, 准确率)78.5678.24
MMLU-Pro(5-shot, 思维链精确匹配)62.5960.93
ARC-Challenge(25-shot, 标准化准确率)91.7292.66
WinoGrande(5-shot, 准确率)76.0976.09
RACE(0-shot, 准确率)88.9088.90
HumanEval(0-shot)79.2775.58
MBPP-Sanitized(3-shot)74.7174.28
GSM8K(8-shot, 准确率)92.4990.14
MATH-500(4-shot)84.4080.60
MMLU Global Lite(5-shot)73.9773.94
MGSM(8-shot, 平均准确率)80.8080.40
质量保持100%98.7%
生成吞吐量(× 自回归)1.0×2.42×
通用知识得分与自回归基线相差约一个点以内。代码和数学能力有适度下降。常识和多语言得分恢复或略有提升。降低 γ 值会使每步确定的模型 token 更多,从而提高吞吐量,但会降低质量。
运行方式:三种生成模式
该检查点提供了三种推理路径。完整的双塔扩散使用 2 个 GPU,在 BF16 精度下每个 GPU 约 59GB。仅自回归模式可在单个 80GB 的 GPU 上运行。
复制代码复制请使用其他浏览器
import torch
from transformers import AutoTokenizer, AutoModelForCausalLM
model_name = "nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name, torch_dtype=torch.bfloat16, trust_remote_code=True,
)
# context tower -> GPU 0, denoiser tower -> GPU 1
model.place_towers_on_devices("cuda:0", "cuda:1")
model.eval()
prompt = "France is a country "
inputs = tokenizer(prompt, return_tensors="pt").to("cuda:0")
outputs = model.generate_mask_diffusion(
inputs["input_ids"], max_new_tokens=128,
block_size=16, steps_per_block=16, mask_token_id=3,
temperature=0.1, confidence_threshold=0.8,
eos_token_id=tokenizer.eos_token_id,
)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))
三个模式分别是 generate_mask_diffusion()、generate_mock_ar() 和 generate_ar()。掩码扩散每步最多提交 block_size 个 token。Mock-AR 和 AR 每步提交一个 token。
适用场景
最直接的用途是加速批量生成。数据团队在生成合成文本时,可以用少量质量下降换取吞吐量提升。在 γ=0.8 时,这种交换是 1.3% 的质量损失换来 2.42 倍速度。
第二种用途是调整质量与吞吐量的权衡。根据 NVIDIA 的论文,提高 γ 可以保留更多质量。降低 γ 则每步提交更多 token 以换取速度。
第三种用途是即插即用式适配。上下文塔保留其语言模型头,用于推测解码、验证或 AR 评分。团队可以基于同一个检查点运行 AR 和扩散。
优势与不足
优势:
采用 NVIDIA Nemotron 开放模型许可协议开源权重,可用于商业用途
在默认工作点下,以 2.42 倍吞吐量保留了 98.7% 的 AR 质量
单个检查点同时支持扩散、mock-AR 和 AR 解码
去噪器使用约 2.1T 个 token 训练,无需完整重新预训练
序列长度缓存内存规模与 AR 基线相当
不足:
完整的双塔扩散需要 2 张 GPU,每张约 59GB BF16 显存
代码和数学任务退化幅度大于通用知识(HumanEval 从 79.27 降至 75.58)
同时保留两个塔会增加固定的模型权重内存占用
发布的检查点是基础模型,尚未经过指令微调或对齐
吞吐量超过 3 倍时质量损失更大
交互式说明
xAI 发布 Voice Agent Builder 测试版
精选理由
xAI 用 Grok Voice 原生的语音到语音路径,把生产级语音代理的搭建门槛降到了无代码、两分钟,计费也简单,做语音业务的人值得试试。
AI 摘要
正文
在不到两分钟内创建一个个性化语音智能体,无需编写一行代码。
隆重推出 Voice Agent Builder——基于我们能找到的最棘手的通话进行训练,两分钟即可得到一个智能体,来看看它的成本,试试看。
免费试用 探索语音智能体
今天,我们宣布 Voice Agent Builder 进入 beta 测试阶段:这是一个零代码平台,让你可以在 Grok Voice 上配置生产级语音智能体。
它面向那些希望获得高并发生产级语音智能体、却不想从头搭建周边技术栈的运营者和开发者。开箱即用,你就能在一个地方获得电话通信、知识检索、工具、防护栏、MCP 和可观测性。你也可以保留已有的东西:通过 SIP 接入现有电话号码,将工具连接到你的 API 和 MCP 服务器,或者通过 WebSocket 连接你自己的客户端。
大多数语音技术栈把三套 API 拼在一起——语音转文字、语言模型、文字转语音——而且每个阶段往往由不同的供应商托管。每一次跳转都会增加成本、延迟和新的故障模式。Voice Agent Builder 是一条端到端语音路径上的统一界面,该路径专为 Grok Voice 构建,与模型紧密耦合,而非由三个独立组件拼凑而成。
视频 1 基于我们能找到的最棘手的通话进行训练
真实的通话包含低质量的电话音频、背景噪音、浓重的口音、打断,以及中途改变主意的来电者。背后的工作流程模糊不清,涉及数十种工具,并且可能以 25 种以上的语言进行。
我们用这些通话训练了 Grok Voice。τ-voice Bench 在相同条件下评测智能体。
τ-voice Bench 排行榜
Grok Voice Think Fast 1.0 67.3%
Gemini 3.1 Flash Live 43.8%
GPT Realtime 1.5 35.3%
总体 零售 航空 电信 两分钟得到一个智能体
设置很简单:用自然语言描述通话应该如何进行,然后附上你的文档、工具和防护栏。从零开始到拥有一个可用的智能体,大约只需两分钟。 教会它你的业务
智能体从一个提示词开始,该提示词描述通话应该如何进行。模型会进行实时推理,因此它能够遵循长指令并处理模糊的请求。
它所“了解”的内容来自**知识库**。你可以上传常见格式的文档(纯文本、Markdown、Word、PowerPoint、Excel、HTML、JSON 等),智能体在通话过程中会从中检索信息。文档被组织成**集合**,你可以将集合关联到一个或多个智能体,并在不同智能体之间共享,这样政策、产品规格和操作手册就能保存在同一个地方,而不必被粘贴到每条提示词里。
**采取行动**
了解业务只是支持或销售通话的一半。智能体还需要**采取行动**。它们需要查询信息、修改记录、转接对话,或在通话结束后完成闭环。
通过**工具**和**连接器**来实现这一点。在预约热线中,智能体可能会在 Google Calendar 或 Outlook Calendar 中安排约会,然后通过你的邮件服务发送确认。在支持场景中,API 请求可以查询订单状态,或在你自己的系统中发起退款。当答案不在你的文档里时,网络搜索或 X 搜索可以拉取当前的公开信息。工单可以在 Linear 或 Notion 中管理,文件则来自 Google Drive 或 OneDrive。
如果来电者需要人工帮助,智能体可以将通话转接到你的团队。任务完成后,它可以干净地结束通话。在整个对话过程中,它会发送实时通知,让你的团队看到智能体做了什么,并在需要时介入。
search_help_center
transfer_to_human
**赋予它声音和号码**
智能体可以使用 80 多种内置语音中的任意一种,也可以使用从大约两分钟的音频中克隆出来的品牌语音。每个账户都包含一个免费电话号码,从第一次测试通话到生产流量均可使用,直接 SIP 可以接入任何主流电话运营商提供的现有号码。你也可以在浏览器中测试更改,无需电话。
**回放通话**
每一次通话都会被录音并转写成文字。你可以回放音频、阅读转录文本,并查看智能体使用了哪些工具。护栏则对智能体不应做的行为施加限制,例如读出信用卡号码或讨论偏离脚本的话题。
**费用是多少**
我们相信定价应该简单透明。智能体按我们的 API 费率计费(目前为 $0.05 / 分钟音频),语音包含在内,没有单独的平台费用。使用免费预配号码的电话服务额外收费 $0.01 / 分钟。
其他语音服务商通常对每个独立组件(语音识别、推理、语音合成和平台)分别计费,每个组件都有自己的计量单位和定价。我们想让计量单位尽可能少,你只需乘以通话量就能算清费用,一次搞定。
试试看
语音智能体靠耳朵听比靠基准测试更容易判断好坏。搭建一个智能体,把最难的流程丢给它,然后打电话试试。
免费试用探索语音智能体
一个隶属于[](https://spacex.com/)的部门
© 2026 xAI Corp.
由 Grok 构建
产品
聊天构建想象语音Grokipedia
下载
grok.comiOSAndroidGrok 上的 X
解决方案
商业政府客服法律安全应用场景
开发者
API 概览定价模型控制台文档状态
企业
联系销售常见问题BAADPA
公司
关于Colossus职业生涯新闻联系
信任
安全隐私门户子处理商帮助中心
法律
条款企业条款隐私CookieAUP品牌
社交
@xai@grokDiscord
由 Grok 构建
Google Cloud Workbench Notebooks 扩展发布:在 VS Code 中连接云端 Jupyter 环境
精选理由
这个扩展把Google Cloud的Jupyter环境直接嵌进VS Code,做ML的开发者不用再切换窗口,工作流会流畅不少,但对行业格局影响不大。
AI 摘要
正文
Google Cloud Workbench Notebooks 的 VS Code 扩展已正式发布,使开发者能够将本地 IDE 连接到可扩展的云端 Jupyter 环境。该集成通过消除上下文切换并提供对高性能 Google Cloud 基础设施的直接访问,简化了机器学习生命周期。为支持透明度和社区驱动的创新,新发布的扩展已完全开源,并可在 GitHub 和 VS Code Marketplace 上获取。
智谱推出GLM-5.2官方开发环境ZCode
精选理由
智谱为 GLM-5.2 推出官方 IDE,1.5 倍配额和自带密钥对已有订阅的人挺实用,但整体只是常规产品完善,算不上行业级事件。
AI 摘要
正文
正式推出 ZCode,GLM-5.2 的官方开发环境
- GLM Coding Plan 订阅用户:现享有 ZCode 中 1.5 倍使用配额 - 支持 BYOK:可与您现有的订阅和 API 配合使用 - 支持 macOS、Windows 和 Linux 平台
立即下载:http://zcode.z.ai/en
Claude Code v2.1.198 发布
精选理由
如果你是Claude Code用户,这次更新很实在,Chrome版终于正式可用,背景agent的自动提PR和通知功能能省不少事,/dataviz也能辅助可视化。
AI 摘要
正文
变更内容
Chrome 中的 Claude 现已全面可用
在 claude agents 中新增后台智能体通知——需要输入或完成处理的会话现在会触发 Notification 钩子(agent_needs_input / agent_completed)
新增 /dataviz 技能,提供图表和仪表板设计指导,附带可运行的颜色调色板验证器
网关:新增 AWS 上的 Claude Platform(anthropicAws)作为上游提供商;未找到模型响应现在会推进故障转移链
从 claude agents 启动的后台智能体,在工作树中完成代码工作后,现在会直接提交、推送并打开一个草稿 PR,而不再停下来询问
内置的 Explore 智能体现已继承主会话的模型(上限为 opus),而不是在 haiku 上运行
子智能体和上下文压缩现在会继承会话的扩展思考配置,从而提升委派任务的输出质量
修复了响应中途因短暂网络断连导致回合中断的问题——像 ECONNRESET 这类瞬态错误现在会进行带退避的重试,而不会直接失败
修复了当沙箱进程反复访问同一网络主机时,后台分类器请求过多的问题
修复了 Web、桌面和 VS Code 任务面板中的后台任务,在完成或恢复会话后仍停留在“运行中”状态的问题
修复了智能体团队:因 API 错误而终止的队友现在会向负责人报告“失败”,并且向卡住的队友发送消息会立即唤醒它重新尝试
修复了在会话外切换分支或提交时,/diff 面板不刷新的问题
修复了全屏模式下 markdown 表格超出右边界并换行的问题
修复了 AWS 上的 Claude Platform 和 Mantle 会话在 STS 令牌过期时以“请运行 /login”结尾的问题——awsAuthRefresh 现在会自动运行
修复了 macOS 后台智能体会话中本地网络主机出现“没有到主机的路由”的问题——现已声明本地网络授权
修复了进入和退出工作树后,/desktop 因“无法确定工作目录”而失败的问题
修复了后台智能体在 macOS 上,当智能体视图处于打开状态时,大约每 52 秒反复显示“正在重新连接……”的问题
修复了在 claude attach <id> 内部按下 ← 键会退出到 shell 而不是打开智能体视图的问题
修复了 `claude --bg` 在与 `--print`/`-p` 组合使用时静默创建无法附加的会话的问题;现在会在前端直接拒绝冲突的标志组合。
修复了工作流进度视图中,在 SDK 和桌面应用会话里最早加入的智能体会从列表中被移除,而阶段计数器仍然正确的问题。
修复了当目标文件通过符号链接路径访问时,`.claude/rules/` 条件规则无法加载的问题。
修复了在 macOS 上的 Warp 终端中,全屏模式下 Cmd+点击无法打开 URL 的问题。
修复了全屏模式下双击选中单词时,无法选中包含协议头的整个 URL 的问题。
修复了计划模式在会话以计划模式启动时,不会自动允许只读工具调用的问题。
修复了 `/branch` 从压缩摘要而非第一个真实提示词派生默认分支名称的问题。
改进了聚焦模式:在一个轮次中启动的子智能体现在会出现在该轮次的活动摘要中,且已完成的后台通知会合并为单个计数。
通过升级至 highlight.js 11,提升了代码块、差异对比和文件预览中的语法高亮准确性。
当通过 SSH 从 Mac 连接时,键盘快捷键提示现在显示 opt/cmd 而非 alt/super。
改进了 API 重试体验:第二次尝试后会显示错误原因,且当 API 过载时,状态页面链接会替代原来的旋转提示。
`/login` 现在会从 Claude 智能体视图打开登录对话框,而不是提示该功能不可用。
子智能体现在将来自启动它们的智能体的消息视为正常任务指令;智能体的消息仍然永远不会被视为用户的批准。
移除了 `/agents` 向导;请直接向 Claude 请求创建或管理子智能体,或直接编辑 `.claude/agents/` 目录。
Cloudflare 推出全新AI流量管理选项:区分搜索、智能体与训练爬虫,保护广告页面
精选理由
Cloudflare 把 AI 流量管理拆成了搜索、Agent 和训练三类,对依赖广告收入的站长是个实用功能,早期控制 bot 访问可能影响 SEO,值得测试。
AI 摘要
正文
在我们的第二个内容独立日,我们为网站所有者提供了更精细的选项来管理 AI 流量。不再采用一刀切的屏蔽方式,所有客户现在都可以轻松区分并管理搜索爬虫、智能体爬虫和训练爬虫,同时还新增了保护广告变现页面的能力。
用 Genkit 构建智能体全栈应用
AI 摘要
正文
The open-source Genkit framework has introduced the Agents API, a full-stack tool designed to simplify the complex plumbing of conversational AI by packaging message history, tool loops, and streaming into a single interface. The API supports flexible, server- or client-managed state persistence—allowing for advanced workflows like history branching, long-running detached tasks, and multi-agent coordination—while seamlessly connecting backends to frontends via a unified wire protocol. Currently available in preview for TypeScript and Go, it also integrates with the Genkit Developer UI to allow developers to easily test, debug, and inspect agent snapshots without writing client code.
Cloudflare 推出 Monetization Gateway:通过 x402 协议为任何资源收费
AI 摘要
正文
We're opening the waitlist for our Monetization Gateway, which will allow you to charge for any web page, dataset, API, or MCP tool behind Cloudflare. The charges will settle in stablecoins over the x402 open protocol, with no payments stack of your own to build.
我们为何构建ADK 2.0
AI 摘要
正文
Answering the questions of "why we built ADK 2.0". This explains the rationale, some of the features, and why a developer should consider upgrading. This will be published the day after ADK go 2.0 launches.
Anthropic在Claude Code中植入隐写术代码识别中国用户
精选理由
Anthropic用隐写术在Claude Code里埋标记的行为,让我对闭源开发者工具的信任打了一个巨大的问号,这事比普通地域封锁严重得多,因为它在不该碰的地方动了手脚。
AI 摘要
正文
公众号正文需在微信内阅读,站内仅提供摘要。
Meta效仿SpaceX,将过剩AI算力变现
精选理由
Meta 进入云市场不只是大厂的新业务,而是算力资产化的信号,未来 AI 竞争可能从模型军备赛转向数据中心所有权,开发者能拿到更便宜的 GPU 但绑定生态的风险也得权衡。
AI 摘要
正文
Meta 已投入数十亿美元开发人工智能并建设数据中心以支持其运行。但现在,这家公司或许正准备将这些数据中心用于更直接盈利的目的。
周三,彭博社报道称,Meta 正在制定云基础设施业务计划,将对外出售 AI 算力和模型访问权限。此举将使其与亚马逊云服务(AWS)、谷歌云和微软 Azure 等大型云提供商展开竞争。
Meta 决定出售富余算力的几周前,SpaceX 通过 xAI 也宣布了类似计划。5 月初,SpaceX 与 Anthropic 签署协议,买断 SpaceX Colossus 1 数据中心的所有算力。此后,SpaceX 还与谷歌和 Reflection AI 签订了类似租约。Meta 也采取同样行动,这表明 AI 竞赛的赢家或许不是提供最佳模型和服务的公司,而是那些拥有数据中心的公司。
当然,前提是算力需求持续存在,且数据中心能保持其价值。一些质疑者警告称,AI 基础设施的建设竞赛正在制造一个泡沫,其基础是快速贬值的芯片。另有人质疑 AI 公司能否产生足够的终端用户收入,来支撑这些万亿美元级别的押注。
这些担忧并未阻止 Meta 大力投资 AI 计算基础设施。截至第一季度末,Meta 已承诺在未来几年内投入 1829 亿美元用于 AI 基础设施,包括正在路易斯安那州和俄亥俄州进行的大型项目。扎克伯格表示,俄亥俄州项目的规模将相当于整个曼哈顿,预计今年将投入使用。
与谷歌和 OpenAI 不同,Meta 自身的 AI 模型和服务并未见到显著需求。Meta 在财报中并未单独公布 Meta AI 或 Llama(其开放权重 AI 模型系列)的收入,高管在公开声明中也主要强调 AI 在企业内部的用途。这可能意味着 Meta 的 AI 业务尚未构成独立的实质性收入来源。
据彭博社报道,为了从自身巨额投入中获得回报,Meta 可能会效仿 CoreWeave 的商业模式,向外部出售“原始”算力。该媒体还报道称,Meta 正在考虑效仿 AWS 的做法,将其 AI 基础设施上托管的多种 AI 模型(包括其最近发布的闭重模型 Muse Spark)的访问权限对外销售。
这项新业务将成为一项名为“Meta Compute”的新计划的一部分,该计划由基础设施负责人 Santosh Janardhan、Meta 超级智能实验室负责人 Daniel Gross 以及总裁 Dina Powell McCormick 共同领导。
该报道证实了扎克伯格在 5 月曾表示,Meta 的云计算业务“绝对在考虑范围之内”,这是一种从公司开发 AI“超级智能”战略的巨额投资中获得回报的方式。
TechCrunch 已联系 Meta 寻求置评。
OpenAI论文揭示GPT-5.6三个Pro变体,打破单一顶级策略
精选理由
论文意外曝光 GPT-5.6 Pro 将有三个变体,Pro 不再只是一个最强模型,而是让用户按推理需求选版本,这才是匹配 200 美元月费该有的逻辑。
AI 摘要
正文
OpenAI 论文揭示三个 GPT-5.6 Pro 模型,打破单一顶级模型策略
Maximilian Schreiner 查看 Maximilian Schreiner 的 LinkedIn 个人资料
Jul 1, 2026
Nano Banana Pro 由 THE DECODER 提示
关键要点
一份 OpenAI 论文首次列出了 GPT-5.6 的三个 Pro 模型:Luna Pro、Terra Pro 和 Sol Pro。此前,Pro 始终是单一的顶级模型。
Pro 用户可能很快可以在速度、吞吐量和最大推理能力之间进行选择。
论文并未说明这一系列是否会实际在 ChatGPT 中推出,并且 Pro 运行的 token 用量仍未披露。
一份 OpenAI 基准测试论文表明,GPT-5.6 的 Pro 层级可能会以三种变体形式推出。这将是自该计划启动以来 ChatGPT Pro 结构的首次重大变化。
OpenAI 于 6 月底正式发布了 GPT-5.6 系列,将其分为三个模型。Sol 处理最难的任务,Terra 面向高容量业务负载,Luna 覆盖更快、更便宜的日常查询。Pro 变体并未包含在该公告中。
现在,一份关于基因组学基准测试的新 OpenAI 论文首次揭示了 Pro 模型。结果表中包含"GPT-5.6 Luna Pro"、"Terra Pro"和"Sol Pro"的行,每个都标注为"Pro (Extended)"运行。
Pro 不再只是一个顶级模型
在基准测试中,Sol Pro 达到了 31.5% 的通过率,成为所有 60 个测试模型中最强的。它超过了标准 Sol 的 28.7% 以及非 GPT 最佳分数——Claude Opus 4.8 的 16.0%。通过率衡量模型完成完整多步骤分析且无错误并得出正确最终答案的频率。
到目前为止,ChatGPT Pro 只是可用的单一最佳模型,比所有其他模型高出一个层级。论文表明这种情况正在改变。它列出了三个并行的 Pro 变体,反映了标准 GPT-5.6 系列:一个快速的、一个高容量的、一个最高性能的。
将每个标准层级在其最高推理设置("max")下与其 Pro 变体进行比较,可以看出收益如何体现。所有值均为完整 129 任务集上的通过率:
在这个层级中,Pro 的升级幅度随着档位升高而递减。Luna Pro 相比标准版提升了整整七个点,而 Sol Pro 仅提升了不到三个点。额外算力对较弱档位的提升更明显:Terra Pro 达到了 28.5%,几乎与标准版 Sol 的 28.7% 持平,这意味着高用量 Pro 变体的表现几乎可以媲美最佳的标准旗舰型号。
与 Pro 一贯的运作方式截然不同
这种分层模式将是自 ChatGPT Pro 推出以来对 Pro 产品的首次重大调整。Pro 不再是一个昂贵的高端档位,而是可能演变为一个包含三款模型的体系,用户可根据具体任务在速度、吞吐量和最强推理能力之间进行选择。
这种分层结构是否真的会在 ChatGPT 中出现,论文并未明确说明。目前这些名称仅来自基准测试表格。
还有一个细节被隐藏了。对于标准版 GPT 模型,论文报告了平均 token 用量作为算力成本的大致代理指标,Sol 在最高设置下约为 33,200 个 token。而对于 Pro 运行的 token 用量,这个数字缺失了。作者表示没有可比的 token 统计记录,但更可能的解释是 OpenAI 根本不想分享这些数据。
亚马逊 AWS 砸 10 亿美元,派遣工程师进驻客户公司
精选理由
AWS 砸 10 亿美元建驻场工程师团队,帮客户 45 天落地 AI 智能体。这不是卖云资源,是卖业务结果,对考虑用 AI 的企业是个信号,巨头开始贴身服务了。
AI 摘要
正文
IT之家 7 月 1 日消息,亚马逊于当地时间周二宣布,将在旗下亚马逊云科技(AWS)云业务板块设立全新部门,组建一批所谓前置驻场工程师团队,派驻至客户企业内部,协助客户更高效、快速落地人工智能软件。
亚马逊云科技前沿人工智能工程与服务副总裁弗朗西斯卡 · 巴斯克斯表示,公司将为该项目先期投入 10 亿美元(IT之家注:现汇率约合 67.97 亿元人民币),计划分批派遣 5 至 6 组工程师进驻客户企业,每组驻场周期为 45 天。
巴斯克斯在该消息发布前接受采访时称:“大量客户都希望我们提供支持,在自身业务流程中落地智能体相关应用模式。”前置驻场工程师具备综合业务能力,直接进驻客户团队,协调客户内部多方协作,编写可投入实际生产的代码,保障 AI 模型产出实际业务价值。
在该赛道布局上,亚马逊入局稍晚。Palantir 设立同类前置驻场工程团队已有十余年;Salesforce、Anthropic 、谷歌云等企业也推出了同类服务。
当下人工智能行业高速扩张,众多科技企业纷纷裁员,而前置驻场工程师相关业务成为行业为数不多的增长点。Box 公司首席执行官艾伦 · 列维今年 5 月在领英发文称,前置驻场工程师“即将成为科技行业需求量最大的岗位之一”。领英今年早些时候发布的一份报告显示,2023 至 2025 年间,市场对前置驻场工程师及同类岗位的需求暴涨 42 倍。
亚马逊云科技表示,新部门员工规模将达数千人,但未披露具体数字;岗位人员一部分通过外部招聘补齐,另一部分由公司内部调岗。自去年 10 月以来,亚马逊已累计裁撤超 3 万名企业岗位员工。
本次新部门发布,是亚马逊在华盛顿举办的为期两天客户峰会的重要环节,峰会期间亚马逊预计还将发布多项政务云相关新品公告。
巴斯克斯称,评判该新部门成效的核心标准,是客户借助亚马逊驻场工程师开发新产品、掌握新技术的速度。“我们要确保客户能在远短于传统项目合作周期的时间内收获实际业务价值。”
亚马逊透露,首批合作客户包括美国国家篮球协会(NBA)与电子企业理光。
Runway 宣布与 Bertelsmann 达成创意合作
AI 摘要
正文
[](https://www.cookiebot.com/en/what-is-behind-powered-by-cookiebot/?utm_source=banner_cb&utm_medium=referral&utm_content=v2) Consent Details [[#IABV2SETTINGS#]](https://runwayml.com/news/runway-announces-creative-partnership-with-bertelsmann#) About
This website uses cookies
We and our third-party partners use cookies, pixels, and other technologies to collect, record, and share information you provide as well as information about your interactions with our site for ad targeting, analytics, personalization, and site functionality purposes.
By continuing to use the site or by clicking one of the buttons below, you agree to the use of these technologies (as described in our ****Privacy Policy**** and subject to your settings) and our ****Terms of Use**** (which contains important waivers).
[#GPC_BANNER_ICON#]
[#GPC_TOAST_TEXT#]
Consent Selection
**Necessary** [x]
**Functional** [x]
**Analytics** [x]
**Advertising** [x]
Show details
Details Necessary 11- [x] These cookies and other technologies are necessary to enable the basic functions of this website, such as page navigation and access to secure areas of the website. Without these cookies and technologies, the website cannot function properly and would not be able to provide the services you are seeking. As a result, you cannot turn this category OFF. Cookiebot 1Learn more about this provider**CookieConsent**Stores the user's cookie consent state for the current domain**Maximum Storage Duration**: 1 year**Type**: HTTP Cookie Google 1Learn more about this providerSome of the data collected by this provider is for the purposes of personalization and measuring advertising effectiveness.
**test_cookie**Used to check if the user's browser supports cookies.**Maximum Storage Duration**: 1 day**Type**: HTTP Cookie bzr.openai.com bzrcdn.openai.com twitter.com vimeo.com x.com 5**__cf_bm[x5]**This cookie is used to distinguish between humans and bots. This is beneficial for the website, in order to make valid reports on the use of their website.**Maximum Storage Duration**: 1 day**Type**: HTTP Cookie bzr.openai.com bzrcdn.openai.com vimeo.com 3**_cfuvid[x3]**This cookie is a part of the services provided by Cloudflare - Including load-balancing, deliverance of website content and serving DNS connection for website operators. **Maximum Storage Duration**: Session**Type**: HTTP Cookie runwayml.com 1**visitor_id**Preserves the visitor's session state across page requests.**Maximum Storage Duration**: 1 year**Type**: HTTP Cookie Functional 1- [x] These cookies and other technologies allow the website to implement optional features and functionality that are not strictly necessary for the website to function, such as remembering your preferred language or the region that you are in. runwayml.com 1**media-chrome-pref-muted**Pending**Maximum Storage Duration**: Persistent**Type**: HTML Local Storage Analytics 6- [x] These cookies and other technologies collect information about how you use the website and how the website performs. Google 2Learn more about this providerSome of the data collected by this provider is for the purposes of personalization and measuring advertising effectiveness.
**_ga**Used to send data to Google Analytics about the visitor's device and behavior. Tracks the visitor across devices and marketing channels.**Maximum Storage Duration**: 2 years**Type**: HTTP Cookie **_ga_#**Used to send data to Google Analytics about the visitor's device and behavior. Tracks the visitor across devices and marketing channels.**Maximum Storage Duration**: 2 years**Type**: HTTP Cookie Vimeo 2Learn more about this provider**orionV3#identity**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: Persistent**Type**: IndexedDB **vuid**Collects data on the user's visits to the website, such as which pages have been read.**Maximum Storage Duration**: 2 years**Type**: HTTP Cookie runwayml.com 2**muxData**This cookie is used in context with a video-player, so that if the visitor is interrupted while viewing video content, the cookie remembers where to start the video when the visitor reloads the video.**Maximum Storage Duration**: 1 year**Type**: HTTP Cookie **rw_attribution**Pending**Maximum Storage Duration**: Session**Type**: HTTP Cookie Advertising 24- [x] These cookies and other technologies are used to track your presence and interactions on the website and to deliver ads that are more relevant to you and your interests based on this information. They are also used to limit the number of times you see an advertisement, and to measure the effectiveness of online advertising campaigns. Meta Platforms, Inc.3Learn more about this provider**lastExternalReferrer**Detects how the user reached the website by registering their last URL-address.**Maximum Storage Duration**: Persistent**Type**: HTML Local Storage **lastExternalReferrerTime**Detects how the user reached the website by registering their last URL-address.**Maximum Storage Duration**: Persistent**Type**: HTML Local Storage **_fbp**Used by Facebook to deliver a series of advertisement products such as real time bidding from third party advertisers.**Maximum Storage Duration**: 3 months**Type**: HTTP Cookie Google 4Learn more about this providerSome of the data collected by this provider is for the purposes of personalization and measuring advertising effectiveness.
**IDE**Used by Google DoubleClick to register and report the website user's actions after viewing or clicking one of the advertiser's ads with the purpose of measuring the efficacy of an ad and to present targeted ads to the user.**Maximum Storage Duration**: 400 days**Type**: HTTP Cookie **pagead/1p-user-list/#**Tracks if the user has shown interest in specific products or events across multiple websites and detects how the user navigates between sites. This is used for measurement of advertisement efforts and facilitates payment of referral-fees between websites.**Maximum Storage Duration**: Session**Type**: Pixel Tracker **_gcl_au**Used to measure the efficiency of the website’s advertisement efforts, by collecting data on the conversion rate of the website’s ads across multiple websites.**Maximum Storage Duration**: 3 months**Type**: HTTP Cookie **_gcl_ls**Tracks the conversion rate between the user and the advertisement banners on the website - This serves to optimise the relevance of the advertisements on the website. **Maximum Storage Duration**: Persistent**Type**: HTML Local Storage Reddit 2Learn more about this provider**rp.gif**Necessary for the implementation of the Reddit.com's share-button function.**Maximum Storage Duration**: Session**Type**: Pixel Tracker **_rdt_uuid**Used to track visitors on multiple websites, in order to present relevant advertisement based on the visitor's preferences. **Maximum Storage Duration**: 3 months**Type**: HTTP Cookie Vimeo 4Learn more about this provider**picox#events**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: Persistent**Type**: IndexedDB **LOCAL_STORAGE_ID_PICOX_ID**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: Persistent**Type**: HTML Local Storage **LOCAL_STORAGE_ID_VIMEO_PLAYER**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: Persistent**Type**: HTML Local Storage **PLAYER_PICOX_SAMPLING_SEED**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: Persistent**Type**: HTML Local Storage YouTube 11Learn more about this provider**__Secure-ROLLOUT_TOKEN**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: 180 days**Type**: HTTP Cookie **__Secure-YEC**Stores the user's video player preferences using embedded YouTube video**Maximum Storage Duration**: Session**Type**: HTTP Cookie **__Secure-YNID**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: 180 days**Type**: HTTP Cookie **LAST_RESULT_ENTRY_KEY**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: Session**Type**: HTTP Cookie **LogsDatabaseV2:V#||LogsRequestsStore**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: Persistent**Type**: IndexedDB **ServiceWorkerLogsDatabase#SWHealthLog**Necessary for the implementation and functionality of YouTube video-content on the website. **Maximum Storage Duration**: Persistent**Type**: IndexedDB **TESTCOOKIESENABLED**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: 1 day**Type**: HTTP Cookie **VISITOR_INFO1_LIVE**Tries to estimate the users' bandwidth on pages with integrated YouTube videos.**Maximum Storage Duration**: 180 days**Type**: HTTP Cookie **YSC**Registers a unique ID to keep statistics of what videos from YouTube the user has seen.**Maximum Storage Duration**: Session**Type**: HTTP Cookie **yt-icons-last-purged**Necessary for the implementation and functionality of YouTube video-content on the website. **Maximum Storage Duration**: Persistent**Type**: HTML Local Storage **YtIdbMeta#databases**Used to track user’s interaction with embedded content.**Maximum Storage Duration**: Persistent**Type**: IndexedDB Unclassified 1 Unclassified cookies are cookies that we are in the process of classifying, together with the providers of individual cookies. Twitter Inc.1Learn more about this provider**i/jot/embeds**Pending**Maximum Storage Duration**: Session**Type**: Pixel Tracker
[Cross-domain consent[#BULK_CONSENT_DOMAINS_COUNT#]](https://runwayml.com/news/runway-announces-creative-partnership-with-bertelsmann#)
[#BULK_CONSENT_TITLE#]
List of domains your consent applies to: [#BULK_CONSENT_DOMAINS#]
Cookie declaration last updated on 6/29/26 by Cookiebot
[#IABV2_TITLE#]
[#IABV2_BODY_INTRO#]
[#IABV2_BODY_LEGITIMATE_INTEREST_INTRO#]
[#IABV2_BODY_PREFERENCE_INTRO#]
[#IABV2_LABEL_PURPOSES#]
[#IABV2_BODY_PURPOSES_INTRO#]
[#IABV2_BODY_PURPOSES#]
[#IABV2_LABEL_FEATURES#]
[#IABV2_BODY_FEATURES_INTRO#]
[#IABV2_BODY_FEATURES#]
[#IABV2_LABEL_PARTNERS#]
[#IABV2_BODY_PARTNERS_INTRO#]
[#IABV2_BODY_PARTNERS#]
About
Cookies are small text files that can be used by websites to make a user's experience more efficient.
The law states that we can store cookies on your device if they are strictly necessary for the operation of this site. For all other types of cookies we need your permission.
This site uses different types of cookies. Some cookies are placed by third party services that appear on our pages.
You can at any time change or withdraw your consent from the Cookie Declaration on our website.
Learn more about who we are, how you can contact us and how we process personal data in our Privacy Policy.
Please state your consent ID and date when you contact us regarding your consent. [x]
**Do not sell or share my personal information**
Allow all Customize Allow selection Deny
[](https://runwayml.com/) Research Product Resources Solutions Company
Enterprise SalesLoginTry Runway
Agent 2.0 is here. Get 30% off any plan with code AGENT
TermsTry now
News/Company News
Runway Announces Creative Partnership with Bertelsmann
July 1, 2026
by Runway
Today, we’re announcing a creative partnership with the international media, services and education company Bertelsmann. As part of this agreement, Runway's AI models will be integrated across Bertelsmann’s global portfolio of businesses, including the RTL Group, BMG and Bertelsmann Marketing Services.
"Content businesses across Bertelsmann are adopting AI at scale, and we are empowering creatives multimodally. Runway enables professional AI workflows and integrations with content generation at high-fidelity level. This progress is illustrated at RTL Group, where Fremantle and its recently launched AI studio ‘Imaginae’ have released first productions, as well as RTL Germany creating advertising and marketing assets and BMG creating visual mar…
Google 2026年6月AI更新汇总
AI 摘要
正文
The latest AI news we announced in June 2026
Jul 01, 2026
Here’s a recap of our biggest AI updates from June, including the launch of Gemini 3.5 Live Translate, the latest features in Android 17 and the new Google Home Speaker, built for Gemini.
Keyword Team
Basic explainer
Google just released a bunch of new AI updates to make your devices and apps more helpful. You can now use smarter tools on your laptop, get better translation features and even use AI to help with your schoolwork. These updates are designed to handle boring tasks so you can focus on what you actually enjoy. It’s all part of their plan to make technology feel like a natural partner in your daily life.
Summaries were generated by Google AI. Generative AI is experimental.
Listen to article
This content is generated by Google AI. Generative AI is experimental
[[duration]] minutes
For more than 20 years, we’ve invested in machine learning and AI research, tools and infrastructure to build products that make everyday life better for more people. Teams across Google are working on ways to unlock AI’s benefits in fields as wide-ranging as healthcare, crisis response and education. To keep you posted on our progress, we're doing a regular roundup of Google's most recent AI news.
Here’s a look back at some of our AI announcements from June.
This month was about creating a more unified environment where AI delivers help naturally throughout your day. With the debut of Android 17 and local models like Gemma 4 12B running right on your laptop, our June updates reflect a vision where technology acts as an intuitive partner and helps you reach your goals. Whether you’re a small business owner trying to get your shop noticed, a student setting up a study schedule or a researcher tackling climate challenges, these updates handle the complex logistics so you can focus on what matters most.
Try Gemma 4 12B, our latest open model. Gemma 4 12B brings smart AI agents directly to your laptop. It runs locally using just 16GB of memory, combining a novel unified architecture with vision and native voice processing in a single streamlined system. This gives you advanced reasoning and private workflows on everyday hardware without sacrificing speed.
Experience computer use in Gemini 3.5 Flash. We integrated computer use into Gemini 3.5 Flash, allowing you to build custom agents that can see, reason and take action across desktop, mobile and browser environments. The update improves performance for long-horizon and enterprise automation tasks, like continuous software testing and knowledge work.
Start building with Nano Banana 2 Lite and Gemini Omni Flash. To make it faster and easier to experiment, refine and scale your ideas , we've launched two major updates. First, Nano Banana 2 Lite is now available and it’s our fastest and most cost-efficient Gemini Image model yet. Second, we're bringing Gemini Omni Flash to APIs in public preview, introducing a natively multimodal model for enterprises and developers to build custom, dynamic video workflows for the very first time.
Check out what's new in Android 17. Android 17 is packed with features like floating app windows for faster multitasking, Screen Reactions for picture-in-picture recording, an optimized layout for foldable gaming and more. You’ll also get more peace of mind with new security upgrades, including the ability to lock a missing phone using your biometrics. These updates are rolling out first to Pixel devices, followed by other eligible Android devices throughout 2026. Plus, take a look at our new personalization and safety features in June’s Android Drop.
Discover the June Pixel Drop. We rolled out new features and Gemini upgrades designed to make your device more creative and secure. This update introduces screen recording reactions, AI-powered video and music creation, and floating app bubbles for easier multitasking. You'll also get expanded real-time voice translation, custom voicemail greetings and automated emergency notifications.
Try the new Google Finance. The new Google Finance is coming out of beta, with several new capabilities to help you better track and understand financial investments. You can monitor your own investment portfolio, stay updated on market intel and get insights on the go with the new Google Finance app for Android — including an AI research tool and AI-powered “key moments” that explain why a stock moved.
Translate speech naturally with Gemini 3.5 Live Translate. This new audio model for live speech-to-speech translation automatically detects more than 70 languages while preserving the speaker's natural intonation and eliminating awkward pauses. You can now have fluid, near-real-time conversations during multilingual calls, meetings or travel, removing language barriers in seconds — rolling out in Gemini Live API, Google AI Studio and Google Translate app.
Get the new Google Home Speaker, built for Gemini. Our new smart speaker built with Gemini makes conversing with your home assistant feel more natural. You don't need to use rigid commands anymore because it understands you just like a real person. It can handle multiple requests at once, answer complex questions and even remember what you were just talking about. Plus, discover 100 new ways to make your day easier with Gemini for Home voice assistant.
Do better research with NotebookLM. We upgraded NotebookLM with advanced reasoning, a secure cloud computer for running code, and the ability to generate charts, spreadsheets and slide decks. The tool now helps you organize loose ideas and gather web sources into a structured research repository — available globally today for Google AI Ultra subscribers and specific Workspace accounts.
Start learning with study notebooks in the Gemini app. Set your goal, upload your class notes, take a baseline knowledge quiz and Gemini will pinpoint exactly where you need help. It can build lessons tailored to your unique learning style and track your progress on a custom dashboard to keep you organized and ahead of the curve.
Elevate teaching and learning with connected AI tools. We introduced new updates across Google Classroom, Chromebooks and Gemini to support both educators and students. Teachers can now securely use real class context to streamline daily tasks and guide curriculum-backed activities, while learners get access to adaptive study notebooks and free standardized test prep to confidently stay on top of their coursework.
Evaluate how AI is improving learning outcomes. Lots of students around the world already use AI tools, but there aren’t many rigorous studies showing how AI can be an effective pedagogical partner. We recently released a study conducted in Sierra Leone, where the need for teachers far outpaces students in the classroom, and AI could play a helpful role to educators. To help scale those results, we also released a free teacher training guide and research playbook.
Explore Colonial Williamsburg with Google Arts & Culture. We teamed up with Colonial Williamsburg to bring American history to life online for the country's 250th birthday. A new digital collection lets you explore 18th-century streets and artifacts, while a custom NotebookLM — including over 150 primary sources and articles — lets you chat directly with the archives to discover how early Americans envisioned their new democracy.
Experience the world’s first AI arts museum. We collaborated with media artist Refik Anadol to open Dataland, the world's first museum dedicated entirely to AI arts. Powered by Google Cloud and Gemini, this living creative space uses neural networks as a new artistic medium, turning billions of data points into shifting, omni-sensory landscapes that prove how technology can expand the boundaries of human craftsmanship.
See how researchers collaborate with Co-Scientist to solve big problems. Launched last year, Co-Scientist is designed for structured scientific thinking, helping life science researchers develop and refine new hypotheses. We shared how global research teams are already putting it to work to tackle massive challenges like infectious diseases, cellular aging and ALS.
Explore how AI could help modernize public services. A new Gemini-powered planning prototype for councils, developed in collaboration with Google DeepMind, Faculty and the UK government, demonstrates how AI can handle administrative backlogs and case analysis to build more resilient communities. By automating hours of manual data extraction and policy cross-referencing, this experiment aims to cut household planning applications by 50%.
Learn how we’re combatting AI scams. We filed a civil lawsuit targeting an organized cybercrime operation known as the "Outsider Enterprise." Based in China and coordinating through Telegram, this network distributes "phishing kits" that allow criminals to blast out fake text campaigns that look like they’re from Google and other trusted brands. We’re also advocating for seven bipartisan bills to fight back against scams, including those created with AI, and using AI-powered tools to fight AI-powered scams.
Learn how AI helps communities brace for extreme weather. At AI for the Planet, we shared how a decade of AI research is tackling climate crises. Our updated models now help predict river floods seven days in advance, track wildfire boundaries via satellite and forecast cyclone paths with high confidence. We've brought these real-time alerts to Search and Maps to help global partners and communities access the actionable info they need to stay safe.
See how AI adoption can support career progression. We worked with Public First — a public policy and research agency — on one of the most comprehensive UK AI adoption studies to date. The research reveals that workplace AI adoption has more than doubled in the past year (up to 73%, from 34% in 2025). It also shows a clear correlation between deep AI use and increased career opportunity. The top 15% of UK AI users are benefitting from the technology. They are fast-tracking their careers and more likely to report strong performance reviews, promotions and pay rises. Public First turned these extensive insights into an interactive AI skills quiz.
POSTED IN:
纽约市教育界和行业领袖齐聚Google AI教育峰会 共议AI课堂未来
AI 摘要
正文
Technology can be a useful tool in the classroom as educators ask a critical question: How do we ensure today’s students are ready for tomorrow’s careers? To support them, Google, the New York Jobs CEO Council and Urban Assembly hosted an AI summit for 150 education and industry leaders.
The goal: drive knowledge sharing between those hiring for the future and educators teaching it. Through hands-on sessions like aiEDU’s “Vibe Coding” and Google’s “Meet LEA,” educators explored how tools like Google AI mode and NotebookLM can spark curiosity and build AI literacy.
A major theme emerged: AI’s true impact is the problem-solving it enables. Industry leaders emphasized that as technology streamlines workflows, "human skills" — like adaptability, collaboration, and critical judgment — become essential.
While embracing these advancements, attendees agreed we must remain uncompromising on privacy and equitable access. The ultimate takeaway: to prepare a generation for the future, technological innovation must happen with schools, not around them.
NYC Public Schools' Chief of Student Pathways Jane Martínez Dowling and Google's Steven Butschi share industry insights during a fireside chat moderated by Urban Assembly CEO David Adams.
A breakout discussion on vibe coding.
Google's Tequila Lamar sets the stage during opening remarks at the AI Summit 2026.
A real-time demo of Google Search Live.
POSTED IN:
mattpocockuk 的 /writing-great-skills:编写可预测 AI Skill 的指南
精选理由
Matt Pocock 把写 Skill 从玄学变成了可拆解的工程,其中领先词和完成标准这两个概念,能立刻让你的自定义工具行为更稳定,搞 Agent 的都应该试一下。
AI 摘要
正文
/writing-great-skills
https://github.com/mattpocock/skills/tree/main/skills/productivity/writing-great-skills
来自 152K✨ Skills For Real Engineers 作者 @mattpocockuk 的新 Skill,教咱们用最少但最有行为牵引力的结构,把 Skill 写成能稳定触发、分层加载、清楚完成、持续删减的"可预测工作流"。
# 跟这个优质 Skill 学它的编写思想
1. Skill 的根本目标是过程可预测
Skill 不是知识库,也不是提示词堆叠。它的作用是让模型在某类任务中形成稳定行为路径。好的 Skill 应该减少"这次做得细、下次做得浅"的波动。
2. 触发方式有成本权衡
它区分两类 Skill:
· Model-invoked:模型能自动发现并调用。优点是无需用户记住,缺点是 description 会长期占用上下文注意力。
· User-invoked:只有用户点名才会触发。优点是零上下文负担,缺点是用户必须记得它存在。
这里很关键:不是所有 Skill 都该自动触发。只有当模型确实需要自己识别任务,或其他 Skill 需要调用它时,才值得让它 model-invoked。
3. description 是触发器,不是简介
对于 model-invoked skill,description 的职责不是介绍得完整,而是准确告诉模型"什么时候该用我"。因此它应当前置关键触发词,只保留真正不同的触发分支,避免同义重复。
这点很实用:很多 Skill 写坏,是因为 description 像产品简介,而不是调用条件。
4. 信息层级决定 Skill 是否清爽
它提出一个三层结构:
· SKILL.md 中的步骤:模型必须按顺序做的事。
· SKILL.md 中的参考:模型运行时需要随手查看的规则、定义、事实。
· 外部参考文件:只在特定场景需要加载的材料。
好的 Skill 不把所有东西塞进主文件,而是用 progressive disclosure:常用、必须、影响流程的内容留在主文件;分支性、解释性、定义性内容放到外部文件,通过明确指针调用。
5. 每个步骤都要有完成标准
它特别强调 completion criterion。一个步骤不能只写"分析清楚""完成检查"这种模糊目标,而要让模型能判断"是否已经完成"。
完成标准越清楚,越能防止模型提前进入下一步,也就是它说的 premature completion。
6. 拆分 Skill 不是为了整洁,而是为了控制注意力
什么时候拆?
· 如果一个 Skill 有独立触发词,可拆成单独的 model-invoked skill。
· 如果后续步骤会让模型急着往前跑,可把流程拆开,隐藏后续步骤,迫使模型认真完成当前阶段。
这很像工作流设计中的"减少提前优化"和"控制认知视野"。
7. leading word 是压缩行为的关键词
它提出一个很有洞察的概念:leading word。也就是用模型预训练中已经熟悉的强概念,来压缩一组行为要求。
例如与其反复写"快速、确定、低开销",不如找到一个更有行为牵引力的词。好处有两个:节省 token,并且更容易稳定唤起模型已有的行为模式。
但它也提醒:弱词可能无效。例如"be thorough"如果只是模型默认会做的程度,那就是 no-op;需要更有约束力的词。
它的失败模式诊断很有用
这个 Skill 给出的几个常见问题非常精确:
· Premature completion:模型过早认为当前步骤完成。优先修正完成标准,而不是马上拆 Skill。
· Duplication:同一个意思出现在多个地方,增加维护成本,也会让某个概念被模型过度重视。
· Sediment:旧内容沉积,没人敢删,导致 Skill 越来越脏。
· Sprawl:内容都有效,但主文件太长,注意力被稀释。
· No-op:看似有用,实际不会改变模型行为的句子。
其中最有操作价值的是 no-op 测试:一句话如果删掉后模型行为几乎不变,它就不该留在 Skill 里。
### 引用推文
> Matt Pocock:/writing-great-skills is quickly becoming my most often-invoked skill It's just really good at writing skills, guys. npx skills add mattpocock/skills --skill wr...
Meta 大规模 AI 存储蓝图
精选理由
Meta的存储架构复盘给出了一条明确路径,从重写元数据到分层缓存,他们把GPU利用率和研究者迭代速度同时提升了一个档次,做AI训练平台的值得细读。
AI 摘要
正文
过去几年间,模型能力与训练数据集规模呈现出指数级增长。而在最近一年左右的时间里,新一代前沿模型的发布间隔已从数月缩短至数周。对于这场 AI 创新的速度与计算成本而言,可靠且快速的数据存储至关重要。如果把 AI 比作大脑,那么存储就是记忆:能力与速度高度取决于记忆容量与检索速度。
然而,尽管 AI 计算性能大约每两年翻三倍,存储和互连性能的增长却相对平缓。其结果是,存储瓶颈依然是导致 AI 工作负载中 GPU 空转的主要原因之一,直接影响了支出成本和上市时间。除了 GPU 利用率之外,存储架构还直接影响 AI 研究的迭代速度;随着 GPU 日益分布在全球各地、数据集规模变得极其庞大,研究人员花费大量时间进行跨区域的数据摄取与迁移,从而拖慢了研究节奏。在这篇博客文章中,我们将讨论 Meta 的 BLOB 存储架构如何演进,以应对两大核心挑战:最大化 GPU 利用率和最大化研究速度。
存储架构概述
Meta运营着数百个艾字节级的存储集群,服务于Meta所有外部和内部产品,包括Facebook、Instagram、Reality Labs、Meta AI、广告、数据仓库和内部数据库。我们的存储服务提供对象存储、文件系统和块设备API,这些API抽象构建在一个名为Tectonic的水平可扩展基础块层之上。Tectonic层是一个区域性、多租户存储架构,利用纠删码技术提供高持久性和高可用性,支持跨介质类型(如HDD和闪存)的分层存储,并管理热数据、冷数据和温数据的智能放置,以实现跨租户的高效I/O利用。在Tectonic之上运行的BLOB存储层展现了一个全局、无限可扩展的存储架构,并提供策略让用户在持久性和可用性之间进行权衡。
在之前题为“训练Llama:存储视角”的@Scale演讲中,我们讨论了Meta如何通过在Tectonic块层之上暴露类似NFS的文件系统接口来直接训练Llama。虽然这种架构在Meta内部仍被广泛使用,但我们的现代训练堆栈已开始逐步迁移到BLOB存储接口之上,这也是整个行业的趋势。这一转变是由于需要统一访问BLOB存储层中的海量数据湖以及高性能需求所驱动的。
最大化GPU利用率
现代AI工作负载“数据饥渴”,并且具有与传统Web应用截然不同的工作负载特征:突发性和持续高吞吐量、可预测且有界的最大延迟、以及变化的I/O模式。近年来,BLOB存储的重点已基本转向最大化GPU利用率。
为什么延迟至关重要
要理解为何有界且低 pMax 延迟如此重要,我们不妨考虑模型训练的过程。在训练过程中,数十万块 GPU 会多次遍历存储中的海量数据(即多个训练周期),并以批次方式训练数据集。每隔一定数量的步数或批次,GPU 之间会同步各自的状态。如果某一块 GPU 速度变慢,这一步就会拖慢所有 GPU 乃至整个训练过程。
图 1 展示了一个跨两块 GPU 的数据加载流水线。每个 GPU 主机上的数据加载器会预取下一个数据集批次,同时 GPU 正在处理当前批次以实现计算与 I/O 的最大重叠。对于 GPU1,存储读取延迟完全在界限之内,因此 GPU 从不会因等待 I/O 而停滞。对于 GPU2,出现两次存储读取延迟过高的情况,导致 GPU 停滞。这些停滞导致整个步骤完成时间被延长。
图 1:跨两块 GPU 的数据加载。
传统 BLOB 存储架构尚未为 AI 做好准备
多年来,BLOB 存储以有机方式演进,以真正的面向服务风格层层叠加。其中许多层是有状态的,并维护着自己的元数据存储。虽然这些元数据访问延迟对于全球 HDD 所服务的传统用例而言通常不是瓶颈,但对于要求毫秒级闪存数据访问的 AI 工作负载来说,它们却是致命障碍。图 2 展示了一个典型的 getObject(“/bucket/path”) API 的请求流程。请求到达 API 服务器后,服务器会在名称层、卷层和容器层中进行多次元数据查找,然后将路径解析为一组 (blockId, offset, size) 元组。其中一些查找可能跨区域,延迟累积到几百毫秒的情况并不少见;只要其中一次查找响应缓慢就足以造成问题。查找完成后,API 服务器将数据从 Tectonic 层代理转发到客户端。
图 2:getObject API 的旧请求流程。
尽管这一架构在传统工作负载上表现出色,但指导设计权衡的基本假设已经发生了变化。其中一些变化包括:
性能与延迟:如前所述,传统工作负载对延迟要求并不高,而 AI 工作负载要求从低分位一直到最高分位(pMax)都保持可预测且有边界的延迟。
可靠性与持久性:旧架构设计为即使在区域故障的情况下也能高度持久且可用;数据与元数据默认全局复制。虽然 AI 工作负载要求极高的可用性,但“默认全局复制”这一设计选择已不再适用。
成本效率:传统存储栈基于 HDD 构建,高度优化每字节成本。AI 工作负载对 IOPS 的要求迫使使用闪存,此外,相对于 GPU 的计算成本,存储的计算成本已变得微不足道。
能源效率:由于 GPU 的使用,数据中心日益受到电力限制而非空间限制。每千瓦电力用于存储,就意味着没有用于 GPU。这是 AI 工作负载带来的新约束。
简而言之,权衡空间已经发生了足够大的变化,促使我们重新思考整个架构。
重建基础
在着手构建新基础时,我们做出了以下主要设计选择:
统一元数据模式:我们重写了元数据子系统,将原本分散在不同层的元数据合并为基于 ZippyDB 的统一扁平模式。这为实现路径到存储地址的 O(1) 查找铺平了道路,是一次阶跃式的改进。
无数据面代理:我们移除了数据面代理,构建了一个胖客户端 SDK,能够直接从存储服务器向客户端流式传输字节。这有助于实现能效目标,同时也能实现更高的吞吐量和更低的延迟。
区域部署:BLOB 存储栈现在更加精简,可以灵活地作为区域或全局服务进行部署。我们现在在每个 AI 区域部署一套与 GPU 同地协作的区域 BLOB 存储栈。
图 3:getObject API 的新请求流程。
图 3 展示了 getObject(“/bucket/path”) 的新请求流程。当客户端上的 SDK 收到该 API 调用时,它现在会向 API 服务器发出一个 getReadPlan(“/bucket/path”) 请求。API 服务器对每个数据块进行一次 O(1) 查找,在元数据存储中将路径映射为 (blockId, offset, size) 元组,然后将 ReadPlanResult 返回给 SDK。SDK 内部嵌入了 Tectonic BlockClient,因此能够直接从 Tectonic 流式读取这些数据块的数据。通过这些改动,我们重新构建了基础架构,并实现了在 Tectonic 之上零额外开销的目标。通过消除数据代理,我们还满足了功耗预算限制。
应对突发流量与热点问题
在数据和检查点加载过程中,AI 工作负载通常会跨数百个 GPU 并发访问数据。像模型权重这样的数据子集往往是“热点”,而 GPU 重启等事件会引发剧烈的流量尖峰。在解决基础问题之后,我们的下一个挑战便是应对这些突发流量与热点。幸运的是,BLOB 存储层多年来已积累应对热点的经验,因此我们将现有解决方案适配至 AI 工作负载。具体来说,我们采用了两种方法:
分布式数据缓存:我们利用 GPU 主机上的空闲内存作为分布式数据缓存,用于缓存频繁且并发访问的数据。为此,我们复用了 Meta Owl 子系统的组件:将 Owl 子系统中的对等节点直接集成到 BLOB 存储客户端 SDK 中,从而使所有数据访问都经过该数据缓存。
读取计划元数据缓存:读取计划(Readplan)指的是从路径到存储地址的映射。现在,我们将频繁访问的 BLOB 的读取计划缓存在一个类似 memcache 的分布式内存存储中。
实践中,我们观察到分布式数据缓存的平均命中率达到 80%,读取计划缓存可在 1-2 毫秒内提供元数据访问。本质上,这些简单机制实现了三件事:
吸收突发流量,减少对存储的 I/O 需求。
解决元数据热点分片问题。
通过从内存提供服务,降低 p50 和 p99 延迟。
协议优化
到目前为止讨论的内容已经帮我们完成了 80% 的工作。剩下 20% 是通过识别并修复整个技术栈中的瓶颈来实现的。以下是一些值得注意的问题,但绝非完整清单:
滞后节点:一个慢速存储节点导致尾延迟。这是一个已被充分理解的问题,我们通过在客户端采用对冲读取(hedged reads)来缓解。
出口流量尖峰:在检查点事件期间,客户端常常会产生剧烈的出口流量尖峰。这反过来又会导致拥塞、超时和重试,最终使 GPU 停滞。我们通过在客户端 SDK 中构建动态并发控制来解决这一问题,该机制根据应用层拥塞信号自动调整并行度。
综合以上所有优化,新的 BLOB 存储栈现在能够服务于 AI 工作负载而不会造成 GPU 停滞,并且在 Tectonic 层之上引入的开销几乎可以忽略不计。我们的下一个工作重点转向了研究。
最大化研究速度
GPU 资源稀缺且日益地理分布化;与此同时,出于性能原因,训练工作负载需要数据与 GPU 同地部署。这给研究人员带来了一个有趣的挑战:他们现在需要负责跨区域摄取和移动数据集。
在 Meta,一个典型的训练任务提交包含以下步骤:
研究人员从各种来源整理数据,对其进行丰富处理后持久化存储到 BLOB 存储中。
研究人员选择一个区域来运行任务。
研究人员提交一个数据摄取任务,该任务将训练数据集以针对 GPU 主机内数据加载优化的文件格式,在目标区域创建快照。
然后研究人员等待摄取完成;根据数据集大小,这可能需要数小时。
研究人员提交他们的训练任务并监控运行情况。
研究人员分析输出结果,调整数据集,然后从第 3 步开始再次迭代。
步骤 2 到 4 可能耗时数小时,直接影响研究人员的迭代速度。理想情况下,我们希望研究人员把时间花在调优模型上,而不是等待存储。目前,研究人员会在启动任务前复制快照,以便让数据与 GPU 同位置存放,从而获得最优性能。虽然这种性能优化对于持续数周或数月的大规模训练任务来说合情合理,但绝大多数任务规模要小得多;负责这些任务的研究人员更愿意用偶尔的性能下降来换取迭代速度。
因此,我们需要一个系统,让研究人员能够一次性摄入数据,并在任何地方访问数据,无需考虑区域边界。我们需要一套工作流,让研究人员能够在几分钟内完成迭代,而不是几小时。当我们重新回到设计阶段时,这些数据集“一次写入、多次读取”的特性让我们灵光一现。如果我们把存储视为一台行星级计算机中的磁盘,并从操作系统领域借鉴一些想法呢?当一个运行在 CPU 核心上的 Linux 进程试图从磁盘读取文件时,操作系统会透明地按需从各层缓存——内存中的页缓存以及 L2 和 L1 CPU 缓存——中补充数据。这一直觉催生了图 4 中的架构演进:
图 4:数据加载架构演进。
核心思想是将各种本地和远程存储资源作为分层缓存来利用,并以 HDD 支持的全局 BLOB 存储结构作为最终的真实数据源。具体来说,我们将 GPU 主机上的内存和闪存作为 L1 和 L2 缓存。我们将由闪存支持的区域 BLOB 存储结构作为 L3 缓存,数据加载器继续通过熟悉的 BLOB 存储 SDK 访问存储。为了有效隐藏延迟并简化数据生命周期,我们依赖以下机制:
数据加载器预取:数据加载器在处理当前批次的同时,将下一批数据集预取到内存中。这种预取操作在 BLOB 存储 SDK 层面会体现为一次读取操作。
深度预取:我们在 BLOB 存储 SDK 中暴露了一个显式的 `prefetch()` API。数据加载器会在后台调用 `prefetch()` API,主动预取接下来几分钟所需的数据。这个 API 会触发从远程存储到本地区域 L3 缓存的数据水合(hydration),同时预热元数据缓存。
自动数据生命周期:L3 区域分布式闪存层中的数据通常会保存一段配置的时间,以便在训练周期中跨轮次复用。我们支持自定义的淘汰策略,包括 TTL 和 LRU 策略。这些淘汰策略也考虑了容量/配额限制。
从生产上线开始,这种新的数据加载范式就被迅速采用,目前我们在生产环境中同时支持两种数据加载范式。为了用数字说明影响,图 5 展示了所有工作负载在上线前后的数据摄入时间对比:
图 5:上线前后的数据摄入时间。
在一个新前沿模型每隔几周就会发布的世界里,这种数据加载范式的转变正是为了更快前进而亟需的变化。
关键要点
现代 AI 工作负载对数据的需求极大,存储对计算成本和创新速度都起着重要作用。存储瓶颈直接影响 GPU 利用率和计算成本,而在 GPU 分布全球的场景下,跨区域数据摄入所花费的时间会直接影响研究的迭代速度。Meta 的 BLOB 存储架构最初是为 Meta 的系列应用服务的,我们需要在性能上实现阶梯式提升,以支持 AI 工作负载。这促使我们重新思考整个架构。通过重建元数据子系统,并采用分层的缓存架构(包含预取和按需水合),我们能够有效满足当前工作负载的需求。
未来工作
我们在 Meta 持续演进存储系统,以跟上硬件演进和工作负载需求。这一领域未来的工作将包括:
将存储扩展到网络极限。
在更大规模下支持检查点操作,而不暂停 GPU。
推理工作负载面临新的挑战,我们正着手应对。
构建AI智能体应优先设计路由
精选理由
Tunguz 把代理架构的设计重心从模型选择拉回到路由上,三层分类器-路由器-选择器的划分很清晰,做 AI 应用的团队可以参考,但其中的新东西不多。
AI 摘要
正文
简言之:优先做好路由,而非纠结于模型选择。绝大多数 AI 工作都运行在廉价的小模型上。
大多数构建 AI 智能体的团队都是先选模型、再定架构。这个顺序搞反了。模型选择应该是最后一步,而不是第一步。
真正重要的是路由器——一段小型代码,用于决定每个请求由哪一层级的模型来处理。把路由器做对,70%-80% 的流量就可以运行在每次调用几乎零成本的局部模型上,或是异步模型上,后者能将 AI 支出削减 90% 以上。
Brian Armstrong 上周也表达了同样的观点,谈及 Coinbase 如何在 token 用量增长的情况下将 AI 支出减半。大意如下:
如何在 token 用量呈指数级增长的同时让 AI 支出保持平稳?答案不是靠增加摩擦和费用预警,而是靠更优的默认配置、路由机制和缓存策略。工程师可以选择任何他们想要的模型,但默认配置至关重要。
路由问题分为三个层级,每一层各司其职:
技能分类器将原始用户请求转化为具体操作。它负责回答“任务是什么”——比如草拟回复、总结代码库、执行数据迁移。分类器的本质是意图识别。
路由器决定由哪个层级来执行已分类的操作。它负责回答“由哪个模型来运行”。路由器并不直接读取提示词,而是读取分类器输出的标签以及若干特征:复杂度、上下文窗口大小、历史成功率。
模型选择器则在同一层级内选出满足置信度阈值的最便宜模型。
分类器与路由器并非同一回事。分类器是语言问题,路由器是调度问题。将两者混为一谈会把模型选择埋进提示词内部,从而丧失对不同模型在同一操作上进行 A/B 测试的能力。
局部计算几乎等于免费。异步批量推理的成本比实时推理低两个数量级。因此,真正的问题变得很窄:有多少工作比例需要实时返回答案?
一旦系统能够将任务加入队列,需要实时响应的部分其实少得惊人。
队列化正是这一策略奏效的关键。草拟回复、总结代码库、撰写尽职调查备忘录、夜间评估任务——这些都不需要在一秒内返回。
我们将第一个版本直接集成到了智能体运行环境中。路由器已经能够根据任务复杂度、上下文窗口大小以及本地记忆检索对任务进行评分。现在,路由器之上又新增了两种反馈机制,它们运行在不同的时间尺度上:
同步故障模式信号。一个预测器为每个传入的路由标注五个特征:缺失的仓库上下文、长依赖链、高风险迁移、安全敏感的提示词,以及高后果写入操作。
夜间闭环反馈。一个批量评估器在夜间对前一天的执行轨迹进行评分,并更新路由器的权重,该过程在 Sail 上通过异步推理运行,使评估成本几乎为零。
同步预测器会在已知困难任务失败之前将其捕获。夜间循环则发现预测器遗漏的新故障模式。
一旦技能蒸馏将操作集扁平化,对于大多数非编码工作,70-80% 的智能体流量可以在本地模型上运行。
其启示是:围绕路由来设计你的系统,而不是围绕模型。最后再来选择你的模型。
异步推理上的全速 Sail——实时推理与异步批量推理之间的成本差异。↩︎↩︎
Brian Armstrong 在 X 上表示——Coinbase 通过更好的默认配置、路由和缓存,在 token 使用量增长的同时将 AI 开销削减了近一半。↩︎
技能蒸馏:教会本地模型像 Claude 一样调用工具,以及 AI 的微型工厂。↩︎
一分钟阅读,将技术数据转化为战略优势。
超过 15 万位创始人和运营者在阅读。
Theory Ventures 的普通合伙人。前 Google 产品经理。分享关于 AI、Web3 和风险投资的数据驱动洞察。
彭博社 • 《华尔街日报》 • 《经济学人》
关于AI重大问题的获奖征文
AI 摘要
正文
Dwarkesh 播客
深度调研式访谈
博客
关于人工智能重大问题的获奖文章
消除流行病 / 为 AI 自动化让路 / 学习香港地铁的商业模式
Dwarkesh Patel
2026 年 7 月 1 日
86
13
11
两个月前,我提出了一些关于人工智能的重大问题。我们收到了 600 篇参赛文章。以下是 3 位获奖者的一些信息,以及全部 3 篇完整文章。感谢每一位参与者!
第一名 – Jassi Pannu
Jassi Pannu 是约翰霍普金斯大学的助理教授,研究方向为生物安全和大流行病防范。她在 Blueprint Biosecurity 的董事会任职。
Jassi 回答了关于 OpenAI 基金会应该做什么的问题。她令人信服地论证了我们可以生活在一个无病世界,并就如何将数百亿美元投入到该项目中提出了非常具体且经过深思熟虑的想法。
第二名 – Ege Erdil
Ege Erdil 是 Mechanize 的联合创始人,这家初创公司为前沿编码智能体构建环境和评估基准。他之前是 Epoch AI 的研究员。
Ege 回答了关于 AI 供应链以外的国家应该采取什么措施,以避免被变革性增长完全边缘化的问题。
他认为,这些国家应专注于实施那些在促进增长和提高生产力方面已行之有效的政策。在这样一个实施这些政策可能带来比今天高得多的增长差异的世界里,这些策略(强大的产权、低资本税和开放的监管体制)将变得更加重要。
我喜欢 Ege 文章的一点是,从某种意义上说,他给出了非常常识性的建议(而不是其他一些参赛者提出的更天马行空的方案——其中一个建议是,中等国家通过威胁炸毁中国和美国的工厂与数据中心来敲诈它们)。但正是这种更接地气、更具永恒性的建议,显得最为反传统。而且它也更有可能奏效。
第三名 – Michael Li
迈克尔·李(Michael Li)是哈佛肯尼迪学院公共政策硕士研究生。他撰写了《Ceteris Paribus》——一个探讨新兴科技、经济与政策交叉领域的博客。
迈克尔写了一篇文章,讨论这些实验室究竟如何盈利。他的文章之所以被选中,是因为他将人工智能实验室与香港地铁(MTR)的商业模式进行了独特的类比——即使你的主业消耗巨额资本支出且无法直接回收成本,或许可以通过收购所有互补性资产来弥补。以香港地铁为例,这些互补资产就是周边地产——我不清楚这对AI实验室意味着什么,但这个类比值得深思。
文章 #1 - 贾西·潘努(Jassi Pannu)谈她会如何运营 OpenAI 基金会
我会以国家级的规模运营这个基金会,目标是终结空气传播疾病。
人工智能在福利方面的最大正面效应(治愈疾病)和最致命的尾部风险(人为造成的疫情)都集中在生物学领域。通过大幅抑制空气传播病原体,我们每年将释放超过1万亿美元的全球GDP(通过终结季节性流感等疾病、减少与病毒感染日益相关的慢性病、生产力损失、医疗保健成本等),并且彻底消除出现灾难性疫情的可能性。
双重回报原则:大多数“让AI发展向好”的干预措施都是针对不良后果(尤其是尾部风险)的保险。我的元层级论点是,将资金转化为影响力的最佳方式,是找出那些在两种情境下都能带来巨大回报的干预措施:既能在日常世界中带来福利的阶跃式提升,又能在紧急情况下大幅降低尾部风险。我在下文描述的生物韧性干预措施就是最好的例子。
人工智能与生物学的结合是攻克疾病的关键路径,但破坏性的能力也会较早出现。
利用 AI 自动化并规模化生物学研究流程的每一个步骤,包括管理流程本身(我称之为自主生物学发现),将使人类更接近一个后疾病世界。在超过 40 亿年的时间里,生命一直在可行的、相互关联的、适应度正向的路径上,于一个天文学意义上微小的子集中随机游走。用于自主发现的多组件 AI 反馈循环(包括生物基础模型和系统性的规模化湿实验室实验),将使我们能够探索更多可能的生物学设计空间。虽然我们最感兴趣的是预测和设计多细胞系统,但操纵更简单病原体的破坏性能力很可能会先行出现。这带来的挑战是,AI 赋能的进攻(引发疫情)将比防御容易得多,而防御仍受到现实世界部署的限制;我认为这有利于那些已经嵌入我们基础设施中的预置防御技术。
有一条明确的路径,可以通过物理基础设施来终结空气传播。
不过,无论你对上述内容持何种看法,单凭日常生活中的益处,终结空气传播也完全有理由成立。呼吸道感染会导致急性疾病和生产力损失,但越来越被证明与痴呆、心血管疾病等相关;即便是“普通”的儿童呼吸道感染,也与长期神经发育结果有关联。
在评估了多种方法之后,我认为终结空气传播比大多数人想象的更容易实现,只需采用一种具体且未被充分重视的方式。此刻我正坐在一栋建筑里,这栋建筑为我提供无病原体的水,让我的食物保持低温且无病原体,帮我加热食物以杀灭病原体,并管道排出污水。我们已在周围环境中嵌入了各种技术,使我们能够生活在一个后霍乱、后伤寒、后痢疾的世界。
有一种被动式、不针对特定病原体(对任何病原体都有效)的物理基础设施技术,能够让我们的建筑物彻底摆脱呼吸道病原体,例如发射对人类安全但对微生物致命的波长(称为远紫外线)的灯具。几十年来,研究人员一直认为这些技术可以大规模发挥作用;我们至今尚未部署它们,主要原因并非技术问题。不妨看看这个类比案例。
我们现在生活在一个天花绝迹的世界里。这是人类最伟大的成就之一。我们花了多长时间才做到这一点?1796年,詹纳证明了疫苗接种可以预防天花。171年后的1967年,D.A.亨德森发起了最终成功根除天花的运动。在那段时间里,人类发现了电磁学、热力学、广义相对论,而且距离登月仅有两年。根除天花只用了短短10年(技术进展有限)。根除天花、普及清洁水和巴氏消毒牛奶的延迟,并非由于缺乏技术进步;它们主要是市场和协调问题,再加上缺乏政治意愿而加剧。这就是为什么这个问题如此适合慈善事业来解决。
终结空气传播的四步计划
总计:在10年内投入约400亿至600亿美元用于建设物理基础设施以终结空气传播;OAIF剩余的资金将用于其他符合双重回报原则的干预措施。到第10年,OECD国家所有小学和主要交通枢纽将默认配备被动式病原体减少基础设施。季节性流感死亡率降低60%。呼吸道病原体达到大流行规模传播的概率降低一个数量级。
推进资金以确定目标产品特征(50亿美元,第1-3年)→ 聘请蓝印生物安全总监Jacob Swett,领导一个DARPA式的项目办公室,专注于:a) 来自人体气溶胶的病原体灭活数据,b) 用于部署的计算建模,c) 超出传统紫外线效应的安全性研究,d) 能够检测到合理效应量级的黄金标准整群随机试验。到第3年底,交付一份经过验证的远UVC灯具TPP,以及证明传播减少超过30%的真实世界有效性数据。
预先市场承诺以保障需求并拉动私人资本(150亿美元,第1-5年)→ 创建阶梯式采购承诺:(a)10万套满足临时TPP的远UVC灯具,(b)100万套满足完整TPP(包括安全性和有效性验证)的灯具,(c)1000万套用于改造特定建筑的承诺(见第3步)。以Kremer的肺炎球菌疫苗AMC和Ransohoff/Frontier的碳清除承诺为蓝本。到第5年,预期将调动300-500亿美元私人资本,并建成足以改造全球约10%建筑存量的供应链能力。
大规模部署以生成证据(150-250亿美元,第2-7年)→ 第2-4年:在全球50大都市区的所有医院和长期护理机构部署。第3-6年:同一都市区的小学和中学。第2-7年:主要机场和高密度工作场所。到第7年,建立扎实的真实世界证据基础。
政治基础设施与政府接手(30-50亿美元,第1-10年)→ 天花根除是一场真正依赖于政治意愿的偶然历史事件。参照洛克菲勒基金会IHD黄热病行动手册,资助一场模因运动,将呼吸道传播从“正常”转变为不受欢迎/非必要,并培训数千名骨干进入各国政府,为全球部署和标准制定构建政治支持群体和制度基础设施。当试点部署在3个OECD国家实现≥40%的减少时,基金会从主要出资方角色转为催化剂角色,激活政府以数量级规模进行采购。
论文 #2 - 埃格·埃迪尔论外部国家在AI生产链中应如何应对
我认为一个很好的基线——很少有国家(无论是否处于AI供应链中)能够超越——就是“什么都不做,并忽视要求采取激进措施的民粹主义压力”。
这是因为人类天生具有技术保守性,并且厌恶导致失业的经济动荡。AI对人工劳动的全面自动化将带来快速的技术和经济进步,而这会导致所有人类失去工作。因此,默认的预期应该是:在AI自动化时代,政策制定将极为非理性和适得其反。
即使对于最有效的政府来说,抵制这种政治压力也已是困难重重。期待那些治理记录不佳的政府(如印度和尼日利亚)做得更好是不合理的。
AI时代的良好政策是什么样的?
在给出这个基本但不够鼓舞人心的答案之后,我将进一步阐述我认为在AI自动化时代良好政策制定的真正重要之处——尽管在实际中,这些内容对政策决策如何做出可能没有多少实际关联。
今天,一个国家的经济产出取决于其自然资源的禀赋、拥有的物质资本和人力资本的数量,以及利用这些资源的效率。AI带来的重大转变将是人力资本从这一方程中消失。如果一个国家希望在劳动全面自动化之后的世界中表现良好,它需要更多的自然资源、更多的资本,或者更有效地利用这些要素的能力——即更高的全要素生产率。
虽然产出的资本弹性将主导所有其他生产要素,但一个国家最终拥有多少资本本身却是内生的。资本比劳动力更容易跨境流动,它很可能流向互补要素(全要素生产率和自然资源)充裕的地方。
因此,我认为AI时代良好政策的支柱在于尽可能朝着以下方向努力:
为AI自动化让路。废除或修订职业许可法、责任法、数据保护法和知识产权法。取消价格和工资管制。瓦解试图保护自身免受AI竞争的人类工人卡特尔和工会。在对人类和AI应用安全标准时保持一致性,而不是偏袒人类。大幅降低创业门槛——因为AI和人类一样需要组织结构来发挥其生产潜力。
提供政治和法律稳定。在不稳定环境下投资将萎靡不振,如果一个国家能在世界可能动荡的几十年中成为稳定的孤岛,它将吸引巨额投资。最低标准是避免内战、革命或政变(对尼日利亚来说并不容易,因为就在2025年9月还发生过一起推翻蒂努布的严重军事阴谋);但这本身还不够。人们必须确信他们的投资不会被没收,其业务的核心运营不会突然被宣布为非法。
增加本国的资本形成。减少或取消资本利得税和企业所得税,不要让重要项目因审批程序而停滞,不要因为“必须支付通行工资”的要求而阻碍建设。取消外汇管制、利率管制和资本管制。
如果AI部署所需的行业存在缺陷,要紧急修复。例如,尼日利亚的电网糟糕透顶,必须在其能够做任何其他事情之前修复,而这又是整个经济体价格体系因政府限制而混乱所导致的后果。如果不修复这一点,该国将永远无法积累在AI自动化时代实现生产力所需的资本。
这些建议听起来很极端,因为人类本能地喜欢偏向劳动而非资本的政策。在我们的现实世界中,资本的产出份额仅占约30%,这已经带来了问题;但在一个劳动已被淘汰、资本产出份额高得多的世界里,这很可能成为关键障碍。
如果一个目前处境不佳的国家成功做到了这些,它们将吸引大量外部投资,并在人工智能自动化的几十年里实现转型。它们此前没有估值万亿美元的AI实验室或芯片制造公司,这并不重要,因为正是那些公司当时正在自动化自己的护城河——即它们的人力资本和组织知识。
这会发生吗?
很可能不会。正如我所说,相关国家过于功能失调,无法采纳这些激进的改革;而目前处于AI供应链中的国家(例如美国和中国)在我列出的指标上已经相对表现良好。
然而,AI供应链之外的国家仍有一些希望:现有领先者可能会搞砸。这并非不可能,因为工业时代的政策质量与AI时代的政策质量之间相关性不会很强——就像世界上最好的采集经济并非最好的农业经济,最好的农业经济也并非最好的工业经济一样。
具体来说,现有领先者可能会取缔关键行业的AI自动化,减缓数据中心建设,剥夺资本持有者,对在医疗和法律等关键行业部署AI智能体实施严格的安全标准,等等。在即将到来的严重非理性时期,它们可能犯的错误几乎无穷无尽。如果一个平庸的国家仅仅坚持住、不犯大错,它们很可能在这一切结束时,相对地位比开始时好得多。
随笔#3 - Michael Li谈实验室将如何赚钱
一家地铁公司解决了AI的商业模式问题。
有一个行业的经济模式是这样的:在赚到一分钱之前,先要投入数十亿美元的 upfront 资本;核心服务定价接近边际成本;为用户创造了巨大价值,但几乎没有任何价值被建设者捕获;而且持续面临投资下一代基础设施的巨大压力。我说的不是 AI 实验室,而是香港地铁(Mass Transit Railway)。
在讨论 AI 的商业前景时,很多人拿铁路来类比。多数人得出的结论是:对于具有公共品属性的通用技术来说,商业可行性的关键在于政府补贴。
我想挑战这个看法,因为香港地铁实际上已经解决了这个问题。它是全球极少数能够实现商业自给自足、公开上市、在不依赖政府运营补贴的情况下派发股息的轨道交通系统之一。
其财务状况在结构上是相同的。
港铁的核心铁路服务从未为自己的扩张提供过资金。在 2018 年(疫情前业绩最好的一年),运输业务息税前利润为 20 亿港元。而 2024–2026 年的预计资本支出高达 879 亿港元,几乎全部与铁路相关。也就是说,三年铁路运营的巅峰利润只够覆盖其中的 8%。铁路从来没能靠票价实现自我造血——它从一开始就不是按这个逻辑设计的。
港铁的票价通过政府票价调整机制保持可负担性。你不能把票价定得足以收回全部建设成本,因为那样会让乘客负担不起,从而违背公共交通的初衷。每条铁路线或许能覆盖自身运营成本,但票务收入永远无法支撑下一条新线的建设。AI API 定价从相反方向也面临同样的约束。知识蒸馏和开源替代方案每年使 API 价格下降大约 10 倍,任何定价高于边际成本的实验室都会因为失去市场份额给竞争对手。每个模型在推理环节可以实现运营盈利,但利润缺口永远不足以支撑下一次训练投入。
标准的全球性解决方案是补贴。伦敦地铁每年需要数十亿英镑的交通局拨款。中国国家高铁背负着万亿美元债务,94%的线路处于亏损状态。AI 正走在同样的轨道上:《芯片法案》、星际之门计划、主权财富基金投资、五角大楼合同。默认的终点是依赖补贴的准公共基础设施。
港铁找到了另一条路。
铁路加物业
当港铁于 1979 年建成时,其设计者就明白,仅凭票价永远无法收回建设成本。因此他们围绕一个不同的前提来构建这家公司:铁路线会让周边的土地变得有价值。那就拥有这些土地。
港铁在其车站上方及周边开发住宅楼、写字楼和购物中心,将自身基础设施所创造的价值增值收归囊中。物业利润交叉补贴铁路运营,并为下一条线路提供资金。如今,港铁拥有 13 个购物中心,管理着 47 个车站上盖开发项目,物业贡献了大部分实际利润。不要试图通过铁路服务本身来获取价值。要拥有那些因铁路服务而升值的资产。
AI 的类比
“实验室何时才能赚钱?”与“铁路何时能仅靠票价回本?”是同样的问题结构。它永远做不到,而这个问题本身就问错了方向。
一家生物科技初创公司使用前沿模型筛选药物化合物,将临床试验缩短了两年。一家物流公司用它优化路线,节省了 4000 万美元的燃料成本。一名独立开发者在一个周末就完成了过去需要五人团队三个月才能完成的工作。在每一个案例中,模型提供商都只通过 API 费用获得了其中极小一部分收益。提供商无法收取更高费用,因为还有其他四家实验室和十几个开源替代方案提供类似的能力。盈余流向了用户和更广泛的经济体。这就是通用目的技术的本质。蒸汽机、电力和 TCP/IP 没有为其创造者带来任何收入。
港铁的启示:别再试图让票价覆盖建设成本。找到你的“物业”。
四个候选方案,按防御性排序
**政府授予的部署权是第一位的。**政府授予某实验室对全国健康记录、税务系统或国防物流的独家部署权限。该实验室积累领域数据、集成深度和监管审批,这些都需要多年才能复制。这就是MTR自身的机制:由国家授予开发权,以自然垄断属性为理由。
**累积的RL奖励数据是第二位的。**数十亿次交互信号用于训练下一代模型。与权重(通过蒸馏贬值)不同,RL数据几乎不可复制,且跨代复合增长。它不直接转化为收入,但这是一块土地储备。增值中的、未开发的。
**前向部署集成是第三位的。**与其将模型访问权限出售给咨询公司以获取生产力剩余,不如端到端拥有服务交付。就像Palantir将工程师嵌入政府机构而非授权软件那样。实验室不向律所收取API费用。实验室成为法律研究服务,根据其交付的成果而非提供的token来定价。转换成本随着积累的领域数据和机构知识而复合增长。这就是MTR的购物中心:捕获铁路创造的客流量,而不是向乘客收取更高的车费。
**国家数据集的数据托管是第四位的。**政府坐拥大量未被充分利用的数据集(患者记录、纳税申报)。被指定为托管方的前沿实验室获得独家权限,可以基于这些数据进行训练和构建产品。稀缺性是真实的,与MTR的土地逻辑相同。你不想让五个竞争的实验室访问五千万份患者记录,就像你不想让五个开发商在同一块地上建设一样。但这会形成公私数据垄断,需要谨慎治理:明确的使用边界、利益回流给公众、独立监控以及滥用行为的真正制裁。
这种重新框架
存活下来的实验室不会是那些让 API 盈利的机构。它们会是那些能够识别自身在“车站之上”的资产、并现在就着手构建的机构。API 就是铁路,它永远无法带来足够可观的利润。真正的财富在于围绕它增值的东西。
随之而来的政策问题是:政府不应补贴训练任务,而应设计制度机制(如部署权框架、数据托管结构、生产力度量标准),让实验室能够捕获其基础设施所创造的盈余。
最后还有一层讽刺意味。AI 政策讨论被美中框架主导——一边是美国自由市场实验室,另一边是中国国有资金扶持的领军者。然而,最相关的制度模式可能两者都不是。它可能是香港模式:一个拥有 45 年历史的公私混合体,由商业运营,通过制度设计而非意识形态实现自筹资金。能让前沿 AI 可持续发展的模式或许早已存在——它只是用来跑火车的。
美团LongCat Owl Alpha:OpenRouter最流行模型,1.6万亿MoE,国产ASIC训练
AI 摘要
正文
在 @OpenRouter 上最受欢迎的模型(10万亿 token)实际上是 @Meituan_LongCat(中国的超级应用/DoorDash)的一个1.6万亿参数 MoE 模型。
基本达到 Gemini / Opus 4.6 的水平。
35万亿 token 完全在5万块中国 ASIC 上训练。
无需 GPU。
https://longcat.chat/blog/longcat-2.0/
你们有些人猜对了。👀 @OpenRouter 上的 Owl Alpha —— 就是我们。
自上线以来,它在日活量上已进入全球前三,并在月活量上位列 Hermes Agent 第一、Claude Code 第二、OpenClaw 第三。
感谢所有在隐身期内测试和使用 Owl Alpha 的人——你们帮助塑造了接下来要推出的产品。
Owl Alpha 即将退役。但这并非终点——敬请期待!
### 引用推文
> Meituan LongCat:Some of you guessed right. 👀 Owl Alpha on @OpenRouter - that's us. Since going live, it has reached Top 3 globally by daily volume - and #1 on Hermes Agent, #2...