马斯克在 X 平台透露,xAI 新一代模型 Grok 4.6 的训练进入最后阶段,参数规模达到两万亿,预计下周完成初步训练。
他表示,该模型在各方面优于当前 1.5 万亿参数的版本,同时推理速度和 Token 效率将接近现有的 Grok 4.5 模型。
马斯克猜测 Grok 4.6 可能会超过月之暗面最新推出的 Kimi 3,但 xAI 尚未公布正式发布时间、训练细节及完整技术指标。
在扩大模型规模的同时,xAI 希望维持与上一代接近的运行效率,此前推出的 Grok 基础模型 V9‑Medium 已完成训练,正进行微调与强化学习。
xAI 持续加大计算资源投入,Grok 4 即使用拥有约 20 万块 GPU 的 Colossus 集群训练,大模型领域的竞争正围绕规模、推理、速度与成本效率展开。
AI 日报 · 2026年07月19日
2026年07月19日日报
今日 AI 日报总结:根据当期推送内容整理,推荐优先关注的方向与热点。向下滚动左侧列表可浏览近半个月往期。
今日导读
今日AI圈热闹非凡。 国内方面,月之暗面在发布最大开源模型Kimi K3后,被曝最快6个月内赴港上市,加速商业化进程; 京东则在WAIC上发布了实时语音与视频编辑两大新模型。 国际方面,马斯克透露拥有2万亿参数的Grok 4.6模型即将完成训练,预计将再次搅动大模型格局。 一场关于AI伦理的讨论也引人注目:作家Dave Eggers受邀到OpenAI总部演讲,直言批评ChatGPT正剥夺一代人的表达能力。
今日要点速览
点击左侧任意资讯,切换到具体文章阅读。
马斯克:Grok 4.6 两万亿参数模型下周完成初步训练
摘要
头部 AI 公司下一代旗舰模型的训练进展,参数规模和性能对比信息密度高。
- 发布时间
- 2026-07-18 7 天前
- 来源
- ithome.com
- 字数
- 313
AI 摘要
正文
月之暗面被曝最快6个月内赴港上市,此前发布最大开源模型Kimi K3
摘要
头部AI独角兽的上市动态及其开源大模型的技术里程碑事件叠加,兼具资本与行业关注度。
- 发布时间
- 2026-07-18 8 天前
- 来源
- 36kr.com
- 字数
- 152
AI 摘要
正文
月之暗面已通知投资者调整公司架构并筹备赴港上市,有望最快在6个月内完成IPO。
7月16日,月之暗面发布全球参数规模最大的开源模型Kimi K3,该模型在Code Arena测试中表现超过Claude Fable 5和GPT-5.6 So。
另有同期外贸数据显示,京津冀、黄河流域及东北地区上半年进出口规模均创历史新高。
微软开源OmniParser-v2.0 GUI解析工具
摘要
微软开源的前沿工具,让AI能精准理解并操作屏幕界面,是构建AI智能体的关键一步,实用价值高。
- 发布时间
- 今日收录
- 来源
- huggingface.co
- 字数
- 57
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
作家受邀给OpenAI员工演讲,批评ChatGPT正夺走一代人的表达能力
摘要
紧扣AI对语言和教育深远影响的深度讨论型资讯,话题性强,观点尖锐且引人深思。
- 发布时间
- 2026-07-19 7 天前
- 来源
- ithome.com
- 字数
- 367
AI 摘要
正文
2026年7月19日,美国作家戴夫·埃格斯受邀为约200名OpenAI员工发表演讲,公开批评ChatGPT对教育和写作能力的负面影响。埃格斯是多部小说、剧本与新闻作品的作者,也是文学杂志及多家非营利机构的创办人。
他直言,ChatGPT给教育工作者带来灾难性影响,让每位教师的工作都比两年前困难无数倍。他强调,如果学生开始依赖ChatGPT写作,他们将永远无法学会真正表达,失去自己的声音和讲述故事的能力,这无异于让一两代人陷入沉默。
埃格斯指出,这种趋势将夺走年轻人真实表达思想的机会。他此前也曾将AI生成的文字形容为“毫无意义的模仿拼凑之作”,其畅销讽刺小说《圆圈》本身即是对科技行业的尖锐批判。
OpenAI首席执行官萨姆·奥尔特曼事先可能已料到这场演讲并非友好交流。此次演讲揭示了科技工具对基础教育与人文表达可能造成的长期损害争议。
360推出TinyR1-32B-Preview 推理模型
摘要
国内厂商360推出的专注于推理能力的32B大模型,展示了其在AI前沿领域的探索。
- 发布时间
- 今日收录
- 来源
- huggingface.co
- 字数
- 62
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
Genkit 推出 Agents API:构建全栈式 AI 代理应用
摘要
显著降低构建高级AI代理的门槛,统一接口设计解决了流式处理和状态管理等核心开发挑战。
- 发布时间
- 今日收录
- 来源
- developers.googleblog.com
- 字数
- 432
AI 摘要
正文
Genkit 推出 Agents API 预览版,目前支持 TypeScript 与 Go。它将构建对话式 AI 应用所需的消息历史、工具调用循环、流式传输、持久化及前后端协议统一封装在一个接口内,开发者只需定义一个 agent 并通过统一的 chat() 方法驱动,即可运行在进程内或 HTTP 端点后。
开发者可通过系统提示、工具、自定义状态和会话存储来扩展 agent。状态管理分为两种:配置存储后为服务端管理,由服务器持久化消息、自定义状态和产物,客户端仅凭会话 ID 继续交互;不配置存储则为客户端管理,服务器返回完整状态由客户端自行维护。每个服务端回合会生成快照,支持按会话 ID 恢复或按快照 ID 从历史节点分支探索。
每个 agent 即为可服务操作,只需几行代码即可通过标准 HTTP mux 挂载为端点,并自动连接回合、快照与中止等路由。同时发布的 JavaScript 客户端通过 remoteAgent() 提供与本地 agent 相同的 chat() 接口,使前端可直接对接同一端点,无需额外设计请求与流协议。
n8n:集成AI能力的开源自动化工作流平台
摘要
集成AI能力的开源工作流平台正式发布,提供可视化与代码结合的自动化方案,对构建AI代理和工作流有较高实用价值
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 402
AI 摘要
正文
n8n 是一个开源的工作流自动化平台,定位为 AI 代理和工作流构建工具,采用公平代码许可。它提供可视化画布,并支持编写自定义代码,可在本地自托管或云端运行,已集成超过 1500 个应用和服务。
平台核心能力包括:AI 原生自动化,允许用户使用自有数据、模型和工具构建并运营多步骤 AI 工作流与代理;模型灵活无锁定,可接入 OpenAI、Anthropic、Google 或开源模型,且切换供应商时无需改动架构。
工作流支持从原型到生产的全过程,可加入逻辑判断、工具调用、人工审批和全链路可观测性。用户在可视化搭建同时,可按需使用 JavaScript、Python 和 npm 包实现高级功能。
企业级特性上,支持自托管或安全部署,提供基于角色的访问控制、审计跟踪和敏感数据处理能力。平台拥有 9000 多个工作流模板,便于快速上手。快速启动可通过 npx 命令或 Docker 部署,编辑器默认在 http://localhost:5678 访问。
Sourcebot:帮助人与AI理解代码库的自托管工具
摘要
面向代码库的AI问答与搜索新工具,提供带引用的答案,对开发者实用性极强
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 323
AI 摘要
正文
Sourcebot 是一个可自托管的代码库理解工具,支持自然语言提问与代码搜索,可帮助用户快速理解项目代码结构。
用户可以向 Sourcebot 提出复杂问题,工具会利用内置的代码搜索与导航能力,结合推理模型跨仓库检索代码、追踪引用,并生成带内联引用和可导航代码片段的详细答案。
Sourcebot 还提供跨平台、跨仓库和分支的代码搜索,支持正则表达式、仓库/语言过滤及布尔逻辑,并具备 IDE 级别的代码导航功能(如跳转到定义和查找引用),以及带语法高亮的文件浏览器。
部署方面,用户可通过 Docker Compose 在几秒内完成自托管,使用 JSON 配置文件指定索引的仓库、语言模型提供商与认证方式。工具默认收集匿名使用数据以改进产品,可通过环境变量关闭遥测功能。
印奇WAIC演讲:当智能体走进物理世界,模型能力跨越临界点
摘要
行业领袖对AI与物理世界结合的深度判断,内容前瞻且具信息密度
- 发布时间
- 2026-07-18 8 天前
- 来源
- 36kr.com
- 字数
- 498
AI 摘要
正文
在 WAIC 2026 开幕式主论坛上,阶跃星辰与千里科技董事长印奇发表题为《当智能体进入物理世界》的演讲。他回顾 15 年 AI 创业历程,认为该领域已从小众赛道发展为全球共识,当前研究者正站在几代科学家与多产业积累的肩膀上。
他指出,2026 年模型能力正跨越临界点:AI 从仅能连续执行数秒任务,进阶到可独立工作数十小时。编程正继自然语言之后成为衡量能力跃迁的新标尺。智能体模型与下一代终端加速结合,使智能从数字屏幕走向物理世界,进化为能感知、决策和执行任务的生产力最小单元,未来个人可拥有专属智能体团队。
印奇判断,智能体浪潮将引发新系统、新载体、新网络三大变革:Agentic OS 通过连接模型与工具决定智能体边界;终端设计转向“人机共生”,电脑、手机、汽车和机器人成为同一智能体的不同“身体”,支持跨终端协同;A2A 网络则让人与智能体连接,智能体拥有身份与信用,自主协作与交易,构成智能体经济基础设施。
他强调,智能体进入物理世界将带来秩序重构,行业需就代表权、责任归属、身份可信与行为可追溯等问题达成共识,探索新技术体系与社会契约。他总结,未来不是机器替代人,而是人与智能共同进化,每个人的可能将被十倍放大。
Project AIRI:自托管的AI虚拟角色灵魂容器
摘要
将AI虚拟角色与游戏、实时语音结合的开源项目,技术方向独特,对AI爱好者有较强吸引力
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 448
AI 摘要
正文
Project AIRI 是一个自托管的 AI 虚拟角色“灵魂容器”,旨在将 Neuro-sama 这类能玩游戏、聊天和互动的数字生命带入现实,让用户随时随地拥有自己的数字伴侣。
项目深受 Neuro-sama 启发,并指出 Neuro-sama 未开源、直播结束后无法交互,而 AIRI 提供了替代方案:基于现代浏览器技术,也提供桌面版(支持 NVIDIA CUDA 和 Apple Metal),可在 Windows、macOS 及移动设备上运行。
AIRI 已具备多项能力,包括 Minecraft 游玩、Factorio 演示、Telegram 与 Discord 聊天,以及本地内存数据库(DuckDB WASM / pglite)、WebGPU 本地推理、客户端语音识别和多提供商语音合成(如 ElevenLabs、Azure、OpenAI 兼容 TTS、Kokoro TTS)等。
项目正在寻求 Live2D/VRM 建模师、计算机视觉、强化学习等领域的贡献者,并发布了至 2026 年 3 月的开发日志,涵盖移动端性能、VRM 生命周期、Dome Keeper 数据采集等进展。
Groq创始人深度洞察:推理越快,模型就越聪明?
摘要
Groq创始人视角,直击推理性能与模型智能的核心议题,颇具话题性。
- 发布时间
- 今日收录
- 来源
- mp.weixin.qq.com
- 字数
- 56
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
从编码代理启动代理商飞轮:自动化评估与迭代优化体系
摘要
提出了一套系统化、自动化的AI代理评估与改进方法,直击从开发到生产部署的质量控制难题。
- 发布时间
- 今日收录
- 来源
- developers.googleblog.com
- 字数
- 710
AI 摘要
正文
谷歌在 Cloud Next '26 大会上提出了一种编码代理质量提升的飞轮方法论,包含构建与测试、发布与监控、学习与优化三个阶段。近日,谷歌进一步发布了面向开发者的实现工具——一个可由编码代理安装并驱动的技能,其核心是与 Google DeepMind 合作开发的 AutoRaters 自动评分系统。
该技能聚焦于构建与测试阶段的快速迭代,将其细化为五个循环步骤:基于 OTel 追踪数据或合成场景准备评估数据集;对数据集执行代理生成追踪记录;使用自适应 AutoRaters 或自定义指标进行评分;通过自动损失分析理解并聚类失败案例;实施针对性修复并重新运行步骤二至四,与先前基准对比。整个循环中,评分阶段始终运行,且优化器与评估器严格解耦,优化代理绝不对自身作业进行评分,而是由 Gemini Enterprise Agent Platform 的 GenAI 评估服务独立完成,以防指标博弈。
该技能并非全自动或绝对真理来源。它发出建议,由人批准,保持人在回路中。内置 AutoRaters 虽能针对多轮对话提取用户意图、生成特定评估准则并多数表决,但仍属模型输出,更适合作为方向性信号,重点参考运行间差值。此外,其用户模拟器生成的合成场景仅用于冷启动,生产数据才是优化循环的真正动力。
这套技能以两种形式提供:google-agents-cli-eval 面向使用 ADK 代理及 agents-cli 工具链的开发者,agent-platform-eval-flywheel 则适用于直接使用评估 SDK 的任意框架。在一个旅行规划代理的实例中,开发者仅以自然语言描述了对“会话中途修改是否被采纳”的担忧,技能便自动分析代码、规划方案,并调用内置多轮评分器及自定义准则来实施检测与改进。
OpenAI CFO 提出衡量 AI 投资回报的实用计分卡
摘要
OpenAI 官方发布的 AI 价值衡量方法论,对从业者评估项目 ROI 有直接参考意义,内容兼具深度与时效性。
- 发布时间
- 2026-07-17 9 天前
- 来源
- openai.com
- 字数
- 86
补充自 2026年07月18日
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
A2A协议一周年:如何构建一个协作式AI智能体世界
摘要
A2A协议周年回顾,阐明了智能体协作的核心价值与技术基石,是了解AI智能体生态发展的重要官方文章。
- 发布时间
- 8 天前
- 来源
- developers.googleblog.com
- 字数
- 603
补充自 2026年07月18日
AI 摘要
正文
一年前谷歌推出智能体间通信协议 A2A(Agent-to-Agent),旨在让 AI 智能体动态协作、安全交接任务。A2A 的设计有别于传统 API:它提供“安全边界”,使调用方只能获得结果而无法接触专有数据与内部流程;避免“上下文污染”,由各专业智能体独立处理复杂依赖,不占用主智能体的上下文窗口;支持动态自主,接收方可理解意图、追问澄清;并实现工作负载分布,让不同团队或供应商各自维护专业组件。
在生命科学领域,Foldrun 作为独立智能体接口展示了 A2A 的实际价值。用户无需自建脆弱的工作流,只需将 Foldrun 智能体接入 Gemini Enterprise、Gemini CLI 等 A2A 兼容环境,即可用自然语言委派任务。Foldrun 能自主管理长期运行的任务,根据预测置信度动态调整参数,并在 AlphaFold 2、OpenFold 3、Boltz-2 等模型间做选择,从而避开从零搭建所需的海量遗传数据库、专用 GPU 及多步建模流程的“复杂性悬崖”。
合作方 BicycleTx 已将 Foldrun 纳入实际流程评估,其反馈直接影响了产品开发。BicycleTx 表示,通过 Gemini Enterprise 中的智能体界面,让科学家团队能更轻松地将共折叠模型能力测试和集成到工作流中。
除科学建模外,A2A 正在推动其他行业的创新。开发者正利用 A2A 实现智能商务和自主支付,让 AI 智能体安全谈判、验证库存并执行 B2B 交易,推动自主经济走向现实。
实战:使用谷歌ADK与A2A协议构建跨语言多智能体团队
摘要
官方发布的跨语言多智能体协作实践教程,对正在探索A2A协议的开发者有极高参考价值。
- 发布时间
- 8 天前
- 来源
- developers.googleblog.com
- 字数
- 451
补充自 2026年07月18日
AI 摘要
正文
生产环境中 AI 系统常由不同团队用不同语言构建,整合这些异构智能体成为现实挑战。本文展示了一个合同合规多智能体流水线:Python 智能体利用 Gemini 提取合同条款,Go 智能体基于确定性逻辑验证合规性,两者通过 Agent2Agent (A2A) 协议互联,并由谷歌的 Agent Development Kit (ADK) 编排。
A2A 协议是开放标准,通过 Agent Card 实现能力发现(在 /.well-known/agent.json 中声明名称、技能、输入输出格式等元数据),通过 JSON-RPC 2.0 的 message/send 等方法通信,并将交互封装为有状态的任务(提交、工作、完成、失败),支持同步和异步工作流。
文章强调了将单体提示拆解为多个专职智能体的三个理由:工具超过10-15个时模型注意力分散导致上下文退化;单点异常会扩大故障范围;纠缠的职责使单元测试困难。这与将单体后端拆分为微服务的思想一致。
ADK 的 RemoteA2aAgent 抽象可将远程 A2A 兼容服务作为本地子智能体调用,无需重写代码,实现跨语言协作。
Kimi K3 与鹈鹕基准测试:我们还能学到什么
摘要
知名 AI 开发者对前沿新模型的深度技术解析,结合经典评测反思方法论,信息密度高,对从业者有实用参考价值。
- 发布时间
- 2026-07-17 9 天前
- 来源
- simonwillison.net
- 字数
- 586
补充自 2026年07月18日
AI 摘要
正文
中国AI实验室月之暗面(Moonshot AI)发布其“迄今最强模型”Kimi K3,参数量为2.8万亿,并承诺于2026年7月27日左右开放权重。官方称其为首个“开放3T级模型”,在部分自报基准测试中超越DeepSeek V4 Pro、Claude Opus 4.8 max及GPT-5.5 high,但落后于Claude Fable 5和GPT-5.6 Sol。
第三方机构Artificial Analysis的报告显示,K3在私有的长周期知识工作评估中获得1547的Elo分,较前代K2.6提升732分,仅次于一闭合模型。该模型的任务成本为0.94美元,接近GPT-5.6 Sol,但约为Opus 4.8的一半;同时输出Token消耗比K2.6减少21%。在Arena.ai的前端代码竞技场中,K3已登顶并超越Claude Fable 5。
K3的定价为每百万输入Token 3美元、输出Token 15美元,达到中国AI实验室发布模型中的最高价位,显著高于前代K2.6的0.95/4美元。
原文作者通过“生成骑自行车鹈鹕的SVG”的老牌非正式测试观察模型特性。该次生成消耗了超1.3万推理Token并花费0.25美元,凸显了K3目前仅有“max”一档推理强度的高成本特点。该模型视觉能力良好,成功输出了SVG及准确的替代文本,但简单的提示词被计为95个输入Token,暗示可能存在85 Token的隐藏系统提示。
AI 编程术语词典:用大白话解释行业黑话
摘要
高质量科普资源,由知名技术作者编写,有效降低 AI 编程领域理解门槛,信息密度高。
- 发布时间
- 8 天前
- 来源
- github.com
- 字数
- 402
补充自 2026年07月18日
AI 摘要
正文
AI编程领域的术语常被有意复杂化,但核心概念可在短时间内掌握。本文档是一份AI编程词汇词典,用通俗语言解释行业黑话,解释为何上下文会退化、账单为何高昂、同一提示为何表现不一致等现象。
模型是只做“下一个token预测”的无状态参数集合,本身无法读取文件或执行命令,所有智能体行为都是由调用模型的工具框架编排多次预测实现的。“AI”一词并非固定技术标签,其指向随时代变化,当前主要指大语言模型。
模型参数是训练时调整的数值,存储了模型全部“知识”,推理时不作改变。上下文窗口容纳输入token,会话和轮次体现交互结构,系统提示设定基本规则。工具与环境包括文件系统、工具调用及结果、权限请求等机制,支持代理执行具体操作。
常见失败模式包括谄媚、幻觉、参数知识截止与注意力预算导致的注意力退化。交接、内存系统与技能等设计用于管理任务传递、知识保持和子代理协作。工作模式涵盖人机循环、自动化检查与审查、氛围编程等实践。