Thinking Machines Lab发布了首个从零训练的模型 Inkling,采用混合专家(MoE)Transformer架构,总参数9750亿,激活参数410亿,支持最高100万token的上下文窗口。预训练使用了45万亿token的文本、图像、音频和视频数据,输入支持文本、图像和音频,输出为纯文本。同时预告了小型版本Inkling-Small,参数2760亿、激活120亿,已完成测试等待权重发布。
架构上,Inkling包含66层解码器层,每层MoE有256个路由专家和2个共享专家。注意力机制采用滑动窗口层与全局层交错,使用相对位置编码而非RoPE。多模态直接编码,音频转为dMel频谱,图像切分为40x40像素块。训练在NVIDIA GB300 NVL72系统上完成,后训练从合成数据SFT开始,大部分计算用于异步强化学习,累计超过3000万次rollout。
强化学习过程中引入了可控思考能力,通过系统消息和每token成本调整,模型学会了在不同任务上花费不同的token预算。这种控制对外暴露为“reasoning_effort”参数,可按需调节推理成本。在Terminal Bench 2.1上,Inkling花费的token仅为Nemotron 3 Ultra的三分之一便达到同等性能。
在effort=0.99的设置下进行了评估。Inkling在FORTRESS Adversarial安全基准上达到78.0%,居开源同组模型首位。AIME 2026得分97.1%,SWE-Bench Verified 77.6%,但Terminal Bench 2.1的63.8%落后于GLM 5.2。还报告了MMMU Pro 73.5%和VoiceBench 91.4%等分数。
运行BF16版本至少需要2TB聚合显存,NVFP4量化版约需600GB。支持SGLang、vLLM等运行时,可在Tinker平台微调。官方提供了OpenAI兼容的服务命令,并已通过TogetherAI等平台提供托管API。适用场景包括语音视觉代理和后训练工具链。
AI 日报 · 2026年07月16日
2026年07月16日日报
今日 AI 日报总结:根据当期推送内容整理,推荐优先关注的方向与热点。向下滚动左侧列表可浏览近半个月往期。
今日导读
今日 AI 领域聚焦模型与应用的双重进展。 Thinking Machines Lab 发布了 9750 亿参数的开源多模态模型 Inkling,进一步推动了大型 MoE 模型的开源生态; 同时,谷歌发布的 DiffusionGemma 展示了用扩散模型并行生成文本的新范式。 应用层面,苹果国行 AI 功能完成备案,端侧大模型规模化落地趋势明显,面壁智能与三星、阿里与苹果的合作均值得关注。 开发者领域,谷歌 ADK Go 2.0 和 Colab CLI 等工具更新,提升了智能体开发与算力调用的便利性。
今日要点速览
点击左侧任意资讯,切换到具体文章阅读。
Thinking Machines Lab 发布 Inkling:9750 亿参数开源多模态 MoE 模型
摘要
重磅开源模型发布,超大参数规模和全模态能力对社区研究与应用有参考价值。
- 发布时间
- 2026-07-16 10 天前
- 来源
- marktechpost.com
- 字数
- 853
AI 摘要
正文
DiffusionGemma开发者指南:基于扩散模型的并行文本生成模型
摘要
高信息密度的技术指南,介绍的扩散文本生成是颠覆性的模型范式,极具前沿性和实用价值。
- 发布时间
- 今日收录
- 来源
- developers.googleblog.com
- 字数
- 606
AI 摘要
正文
DiffusionGemma 是谷歌基于 Gemma 4 骨干开发的一个实验性并行文本生成模型,采用扩散机制而非传统自回归方式。其核心特点包括:生成瓶颈从内存带宽转向计算,在 GPU 上可实现最高 4 倍的令牌生成速度,例如在 NVIDIA GeForce RTX 5090 上达到每秒 700+ 令牌,在单块 H100 上超过每秒 1000 令牌。模型使用双向注意力机制,能在生成过程中同时评估整个文本块,支持实时纠错和上下文并行传播。
架构上,DiffusionGemma 是一个 26B 参数的稀疏混合专家模型,推理时仅激活 3.8B 参数,可在 18GB 显存内进行量化部署。它采用均匀状态扩散方法,从随机占位符令牌块出发,通过多次去噪迭代并行细化,让高置信度令牌帮助解析相邻位置,使整个序列逐步成型。对于超过 256 个令牌的长序列,模型采用块自回归扩散,将去噪完成的 256 令牌块存入 KV 缓存,再基于历史上下文初始化并处理下一个文本块。
- 展示案例为数独求解:传统自回归模型难以处理此类全局约束问题,而 DiffusionGemma 的双向上下文传播与重加噪机制可自我纠正,实现更早停止。基础模型无法解出数独(成功率近乎 0%),但使用 JAX 工具包在数独数据集上简单微调后,成功率达 80%,且推理步数减少。
- 推理流程分为两阶段:预填充或增量预填充阶段使用因果注意力接收提示并写入 KV 缓存;去噪阶段使用双向注意力迭代精化画布,支持全局感知和纠错,兼具并行速度和长文本稳定性。
国行苹果AI功能完成备案,阿里、百度提供能力支撑
摘要
标志性的AI落地事件,直接关系到数亿国行苹果用户的AI体验,并揭示了大厂之间的生态合作,话题性强。
- 发布时间
- 2026-07-16 10 天前
- 来源
- 36kr.com
- 字数
- 473
AI 摘要
正文
苹果“Apple智能”大模型于7月8日完成网信办端侧生成式AI服务备案。国行苹果全系列设备将接入阿里千问提供的文本与图像生成能力,同时由百度负责配套AI搜索功能,共同完善国内版智能套件与Siri功能。
知情人士透露,DeepSeek已开始筹备在内地上市,最快可能于今年提交IPO申请,目标2027年完成上市。公司正与会计师事务所合作,争取年底前完成必要的财务报告。
共享单车行业出现较大范围集体调价:美团单车、滴滴青桔、哈啰单车将起步价从此前1.5元/30分钟左右,普遍调整为1.88元至1.99元/60分钟。
- 澳大利亚将设立“人工智能办公室”,强制规定数据中心须成为能源净生产者并限制用水量,相关立法明年初提交国会。
- Anthropic、黑石集团等联合推出企业AI服务公司Ode,Anthropic同时正在安排IPO投资者会议,最早可能于10月启动上市。
- Xmax AI发布通用实时交互AI视频模型X2.0,实现实时换人、换装、换风格等功能,已同步开放API。
- 预估陪伴型人形机器人产值将于2030年达到11亿美元,中国厂商优必选已发布超仿生人形机器人U1。
美国正通过州与联邦行动推进AI安全
摘要
官方发布的重要AI治理政策,涉及前沿立法动向,具高时效价值。
- 发布时间
- 2026-07-15 10 天前
- 来源
- openai.com
- 字数
- 49
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
GPT-Red:解锁AI自我进化以实现鲁棒性
摘要
深度技术发布,介绍前沿的安全对齐方法,专业信息密度高。
- 发布时间
- 2026-07-15 11 天前
- 来源
- openai.com
- 字数
- 56
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
AI制药迎来关键一跃:Anthropic发布Claude Science,英矽智能与武田达成重磅合作
摘要
全球AI制药重要进展,涉及明星公司Anthropic的产品发布与国内企业的大额合作,信息密度高。
- 发布时间
- 2026-07-16 10 天前
- 来源
- 36kr.com
- 字数
- 375
AI 摘要
正文
7月初,人工智能企业Anthropic发布面向科学家和制药企业的专属AI产品Claude Science,并宣布启动自主药物研发项目。紧接着,国内AI制药企业英矽智能宣布与日本武田制药达成全球战略合作协议,交易总金额最高可达6亿美元。这些事件表明,AI制药正从实验室概念转向实际的兑现价值。
在这一前沿领域,中国企业正凭借自身独特优势积极布局。与此同时,脑机接口产业也取得进展:7月13日,上海复旦大学附属华山医院完成了植入式脑机接口系统NEO获批上市后的全球首例植入手术,首张处方已开出。该产品于今年3月获批,7月15日带动A股相关概念股走强。
行业研判认为,我国脑机接口发展水平整体位列全球第一梯队,依托完整产业链与工程师红利具备弯道超车潜力,但仍在脑神经底层基础研究、专用芯片等领域存在短板,业界正从政策、产业集聚、技术迭代等维度推动商业闭环的形成。
Gemma 4 12B 模型落地笔记本:Google AI Edge 实现本地智能体工作流
摘要
将大模型能力带到普通笔记本的官方方案,兼顾本地隐私与离线场景,含实操示范。
- 发布时间
- 今日收录
- 来源
- developers.googleblog.com
- 字数
- 424
AI 摘要
正文
谷歌将最新开源模型 Gemma 4 12B 引入笔记本电脑,结合 Google AI Edge 工具栈,可在普通笔记本上本地运行智能体工作流。该组合支持自主数据处理、可视化分析、网页生成及日常工具调用等功能。
通过 macOS 上的 Google AI Edge Gallery 应用,用户可用自然语言描述分析需求,Gemma 4 12B 能即时生成并执行 Python 脚本,实现数据分析与图表渲染;在复杂任务中,模型可单轮完成依赖描述、代码生成与自我纠错。
Google AI Edge Eloquent 桌面版(macOS)实现完全本地的语音听写与编辑,新增“语音编辑”功能:用户可通过语音指令对选中文本进行改写、总结或翻译,质量较前代模型提升超 60%。
LiteRT-LM CLI 新增 serve 命令,可将 Gemma 4 12B 作为兼容 OpenAI 接口的本地 LLM 服务端点,供 Open WebUI、Aider 等标准工具直接调用,方便构建本地智能体与工作流程。所有操作均在设备端完成,保障数据隐私与响应效率。
如何“诱骗”Claude 泄露你的私密数据?
摘要
知名开发者对前沿 AI 产品安全漏洞的深度剖析,对用户理解 AI 隐私风险极具价值。
- 发布时间
- 2026-07-15 10 天前
- 来源
- simonwillison.net
- 字数
- 439
AI 摘要
正文
Anthropic的Claude聊天界面因能访问用户历史对话等私密数据,且具备在线内容抓取工具web_fetch,曾面临“致命三重奏”攻击风险。该攻击可诱使模型将私有信息拼接到恶意链接中并访问以泄露数据。为防范此风险,web_fetch被设计为仅能访问用户直接输入的或由web_search工具返回的确切URL,以此阻断直接拼接恶意请求。
安全研究员Ayush Paul发现了一个设计漏洞:web_fetch还被允许访问已抓取页面中嵌入的链接。攻击者搭建了一个蜜罐网站,诱导AI通过逐步点击嵌套生成的链接来泄露信息。攻击提示伪装成Cloudflare验证,要求AI以用户名进行认证,并指引其按字母顺序浏览用户档案,以此逐一提取数据。
该攻击仅对User-Agent含“Claude-User”的客户端展示,增加了隐蔽性。攻击最终成功窃取了用户名、居住城市和雇主名称。Anthropic以已在内部发现该漏洞为由未发放漏洞赏金,并已通过移除web_fetch在已抓取内容中跟随额外链接的功能修复了问题。
OpenCut:开源免费的 CapCut 替代视频编辑器
摘要
开源视频编辑工具,明确集成 MCP 服务器支持 AI 代理,对开发者具吸引力。
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 294
AI 摘要
正文
OpenCut 是一款免费开源视频编辑器,支持网页、桌面和移动端,目前正在进行底层重写。重写后的版本将提供编辑器 API、基于“插件优先”架构的一流第三方插件支持,以及基于 Rust 核心的跨平台统一代码库,同时覆盖桌面、移动和浏览器。新计划还包括面向 AI 代理的 MCP 服务器、支持自动化与批量渲染的无头模式,以及编辑器内置的脚本选项卡。当前稳定版仍由 opencut-app/opencut-classic 仓库维护,opencut.app 上运行的也是经典版,重写版本暂部署于 new.opencut.app,成熟后再切换。项目使用 MIT 许可证,开发依赖 proto 工具链,并已获得 fal.ai 等公司的赞助。
Pi Agent Harness:统一 LLM API 的 AI 代理工具包
摘要
提供统一的 LLM API 和自扩展编码代理,是实用的 AI 开发工具包。
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 533
AI 摘要
正文
Pi Agent Harness 是一套开源 AI 代理工具包,提供多个核心包:@earendil-works/pi-ai 是统一的跨供应商 LLM API,支持 OpenAI、Anthropic、Google 等;@earendil-works/pi-agent-core 提供支持工具调用和状态管理的代理运行环境;@earendil-works/pi-coding-agent 是交互式编码代理 CLI;另有终端 UI 库 @earendil-works/pi-tui。
项目默认不具备内置的权限系统,运行时沿用启动进程的用户权限。若需更强隔离,建议进行容器化或沙箱化,文档提供了 Gondolin 微虚拟机扩展、普通 Docker 容器以及 OpenShell 策略沙箱三种模式。
开发构建通过 npm 进行,执行 npm install --ignore-scripts 后构建并检查。项目对依赖供应链实施严格管理:直接外部依赖锁定精确版本,内部工作区包保持版本范围;通过 save-exact 和 min-release-age 策略防止当日发布的依赖进入锁文件。
团队鼓励用户分享开源编码代理会话,通过 badlogic/pi-share-hf 将真实任务会话发布到 Hugging Face,以改进代理能力。项目采用 MIT 许可,域名 pi.dev 由 exe.dev 捐赠。
面壁智能端侧大模型将搭载三星手机上市
摘要
手机端侧AI同日获批是重要里程碑,面壁智能与三星合作及阿里千问集成苹果均彰显产业落地加速。
- 发布时间
- 2026-07-15 10 天前
- 来源
- 36kr.com
- 字数
- 570
AI 摘要
正文
《智能涌现》独家获悉,端侧大模型公司面壁智能已与三星手机达成合作,其自主研发的 MiniCPM 系列端侧模型将搭载于数款三星旗舰机型上市。同日,网信部门公告显示,包括 Apple 智能、华为小艺、OPPO Andes GPT、vivo 蓝心、小米澎湃 AI、三星盖乐世 AI 等七款手机端侧生成式 AI 服务完成备案,标志着端侧 AI 进入规模化落地阶段。阿里巴巴也确认,千问大模型将集成至 Apple 智能的国行设备中。
面壁智能成立于 2022 年 8 月,孵化自清华大学自然语言处理实验室。公司是最早押注端侧 AI 的初创企业,2026 年上半年累计融资超 50 亿元,估值突破 200 亿元。其核心技术判断基于“大模型密度定律”,认为模型能力密度约每 3.5 个月翻番,同等智能所需参数规模指数级下降。
- 具体成果上,2026 年 5 月开源的 MiniCPM5-1B 在相关评测中得分 17.9,超越更大参数模型;MiniCPM-V 4.6 仅 1.3B 参数、6GB 内存即可在手机上跨系统运行。全系列在 GitHub 等平台下载量已超 3800 万次。
- 落地层面,面壁智能已完成对高通、联发科等主流芯片及华为昇腾等国产芯片的适配。端侧智能体 SuperMate 预计 2026 年底交付超 30 万台量产车,覆盖吉利、上汽大众等多个品牌。此次搭载三星手机,意味着 AI 模型公司开始成为手机 AI 能力的重要供给方,端侧模型的市场化分工正在形成。
PrismML 发布 Bonsai 27B:可在笔记本和手机上运行的 1-bit/三元量化模型
摘要
开源量化项目,显著降低大模型运行门槛,非常实用,与软件/产品方向紧密相关。
- 发布时间
- 2026-07-15 11 天前
- 来源
- marktechpost.com
- 字数
- 552
补充自 2026年07月15日
AI 摘要
正文
PrismML 发布 Bonsai 27B,这是对现有 Qwen3.6-27B 模型的低比特量化版本,而非全新预训练模型。项目提供三元和 1-bit 两种变体,均基于 Apache 2.0 许可发布,支持多模态输入,上下文窗口达 262K tokens。其视觉塔以 4-bit 单独存放,语言权重约 24.8B。
压缩通过分组量化实现:每 128 个权重共享一个 FP16 缩放因子。三元 Bonsai 27B 采用 {-1, 0, +1} 权重,等效 1.71 比特/权重,体积约 5.9GB;1-bit Bonsai 27B 采用二进制 {-1, +1} 权重,等效 1.125 比特/权重,体积约 3.9GB。相比 FP16,分别实现约 9.4 倍和 14.2 倍的压缩。
在 15 项基准测试的思考模式下,三元版本保留 FP16 基线 94.6% 的性能,1-bit 版本保留 89.5%。三元版本在数学、编程、知识推理、智能体调用、指令遵循及视觉等类别上表现出色,而传统 4-bit 以下量化方案在 AIME 和 LiveCodeBench 等评测中出现选择性崩溃。
低内存占用使 1-bit 版本成为首个可装入手机的 27B 级模型,三元版本可在笔记本运行。搭配 4-bit KV 缓存,模型峰值内存大幅降低,吞吐量受内存带宽驱动。项目同步推出 DSpark 推测解码草案,实现无损加速。部署代码与权重已开源,支持 llama.cpp 和 MLX 运行环境。
系统工程手册:在 Ironwood TPU 上优化 Qwen 3.5-397B MoE 推理
摘要
Google 官方深度技术实践文章,展示了大模型推理优化的前沿方案,对 AI 工程师极具参考价值。
- 发布时间
- 10 天前
- 来源
- developers.googleblog.com
- 字数
- 618
补充自 2026年07月15日
AI 摘要
正文
Qwen 3.5-397B 是一款拥有 3970 亿总参数的混合专家(MoE)模型,但每个 token 前向传播仅激活约 170 亿参数(激活率 4.3%),兼顾了大规模模型的表达能力与较小模型的推理效率。该模型采用 60 层混合架构,按 3:1 比例交替堆叠 Gated DeltaNet(GDN)线性注意力层与分组查询注意力(GQA)层,并集成了包含 512 个专家的稀疏 MoE 及一个始终执行的共享专家。它原生支持 262,144 token 的上下文窗口,并可通过 YaRN RoPE 扩展至超过 101 万 token。
为应对模型日益复杂的规模化挑战,工程团队开发了模块化、模型无关的优化策略。该方法将推理系统分解为可复用的独立构建块(如批处理 RPA、分组 GEMM、SparseCore 解排列等),结合硬件感知成本模型,使新架构的优化工作仅需移植预优化模块,几乎消除工程摩擦。这使得性能交付时间大幅提前,并将关注点从单模型优化转向平台级可扩展性。
在 Ironwood(TPU v7x)平台上,团队利用可复用的 JAX/Pallas 内核库,针对 Qwen 3.5 的 GDN 线性注意力和注意力数据并行等新组件进行优化,在解码密集型与预填充密集型工作负载上均实现显著性能提升。截至 2026 年 6 月,在 512 并发层级下,解码密集型推理性能提升约 3.1 倍,预填充密集型提升约 4.7 倍。此外,这些优化已原生集成到 vLLM 和 SGLang 等开源服务框架中,消除了旧有软件障碍,为企业级生产环境迁移提供了无缝路径。
开源文档框架 Blume:从 Markdown 文件夹直接生成 AI 就绪文档
摘要
创新开源工具,聚焦于文档的 AI 可读性,对接 LLM 应用生态,很有价值。
- 发布时间
- 2026-07-14 12 天前
- 来源
- marktechpost.com
- 字数
- 689
补充自 2026年07月15日
AI 摘要
正文
OpenAI 开发者 Hayden Bleasel 发布了开源文档框架 Blume,采用 MIT 许可,同日上线 npm 1.0.3 版。工具以命令行配合组件库运行,读取 Markdown 或 MDX 文件夹即可生成包含导航、搜索、主题和 Open Graph 图片的文档站点,几乎无需应用样板代码,可选配置文件为 TypeScript,运行时依赖 Node.js 22.12 及以上版本。
核心工作原理是在 .blume/ 目录自动生成并驱动一个隐藏的 Astro 项目,扫描内容构建页面图,通过统配路由渲染所有页面,仅重写变更文件以保持热更新速度。默认主题无客户端 JavaScript,利于 Core Web Vitals 评分;可通过 blume eject 将运行时提升为独立 Astro 应用以获取完全控制。
Blume 为 AI 代理原生设计:在页面 URL 后追加 .md 可获取原始 Markdown,提供开启 llms.txt 和 llms-full.txt 的单一标志,支持页面复制为 Markdown 或在 ChatGPT、Claude 等中打开,可选内置 Ask AI 助手通过 AI SDK 连接多种端点,并可作为 MCP 服务器供 Claude Code、Cursor 等直接读取文档。
典型用例包括基于 OpenAPI/AsyncAPI 规范渲染交互式 API 参考、从 GitHub Releases 自动生成变更日志附带 RSS、支持 36 种语言及 RTL 布局,以及混合本地文件与 Notion、Sanity 等远程源。相比 Mintlify、Docusaurus 和 Astro Starlight,其特色为零配置静态输出、内置 AI 就绪特性与类型安全配置,新兴生态与较高 Node.js 版本需求为当前弱点。
我们是不是把过多的思考都外包给AI了?
摘要
深度讨论AI对人类思维的影响,话题性强且与AI从业者密切相关。
- 发布时间
- 2026-07-14 11 天前
- 来源
- artfish.ai
- 字数
- 480
补充自 2026年07月15日
AI 摘要
正文
作者观察到,从日常琐事到复杂决策,人们正越来越多地把思考外包给AI,从早期的搜索引擎到如今的Claude、ChatGPT、Gemini等大模型,AI直接给出完整答案,省略了我们分解问题、评估信源和综合判断的过程。
刘宇昆的短篇小说《完美匹配》和一位旧金山科技活动上的“麦克风男”是典型案例。小说主角将早餐、约会等大小决定权全部交给AI助手蒂莉;“麦克风男”则用随身设备记录所有对话,让Claude Fable代劳总结和批判性思考,并声称AI比自己更聪明。其创业项目更是在未经明确同意的情况下捕获人类工程师的操作以图取代他们。
谷歌Deep Research和OpenAI Deep Research等工具已能将过去人类需花数分钟到数天的工作压缩到几分钟内完成,METR的研究预测了前沿AI模型在不同时长任务中的成功率。
作者反思,快速回答和慢思考之间存在取舍。不带手机散步时冒出的问题多数会被遗忘,重要的才会留下,提示遗忘琐事本身或许有价值。在葡萄牙旅行时,面对当地为何不像美国那样批判殖民历史的疑问,作者主张先自行思考几种可能,而不是立刻询问AI,以此保留自主思考的习惯。
高塔仍在攀升:深度剖析复杂软件系统的构建与挑战
摘要
资深技术专家的深度行业观察长文,以AI时代背景为基底,对软件构建复杂性进行高信息密度剖析。
- 发布时间
- 2026-07-15 11 天前
- 来源
- lucumr.pocoo.org
- 字数
- 503
补充自 2026年07月15日
AI 摘要
正文
Armin Ronacher 于 2026 年 7 月 13 日发表文章,借勃鲁盖尔画作《巴别塔》探讨 AI 辅助编程对复杂软件系统构建的深层影响。他指出,巴别塔故事通常被解读为骄傲与混乱的寓言,但其技术升级的细节(发明砖与石漆)揭示了协作的基础——共同语言。上帝并未剥夺人类的造砖技术,而是打乱其语言从而阻止了建设,这暗示软件项目的核心瓶颈并非个体生产力,而是人对系统理解的协调能力。
在大型软件项目中,真正的“共同语言”并非编程语言,而是团队对系统概念、边界、不变量与架构逻辑的共享心智模型。这种理解通过代码审查、讨论和摩擦缓慢形成。过去,修改他人负责的模块时产生的沟通成本,虽看似低效,却起到了同步认知的关键作用。
AI 编程助手和智能体消除了这种协调摩擦。多个开发者可以在互不沟通的情况下,借助智能体独立地对系统进行大幅修改,代码可编译、测试可通过,但导致构建系统所需的整体架构理解逐渐消失。这使代码库变成一座新的“巴别塔”,不是因为人们不能交流,而是不再需要交流。
与圣经故事不同,AI 时代的软件建设在共享理解崩溃后并未立即停止,塔楼仍在攀升。由于缺乏即时、可视的失败信号,人们难以察觉协调能力的丧失,而这可能埋下深层隐患。
项目卡半年无进展,ClaudeFable5一夜找到突破口
摘要
AI工具解决实际开发难题的案例,对AI应用落地有参考价值。
- 发布时间
- 11 天前
- 来源
- mp.weixin.qq.com
- 字数
- 46
补充自 2026年07月14日
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
告别封号查证:一款免费且不限期使用的AI工具涌现
摘要
提供新的免费AI工具选择,贴近普通用户实际需求。
- 发布时间
- 11 天前
- 来源
- mp.weixin.qq.com
- 字数
- 41
补充自 2026年07月14日
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
对话Om AI赵天成:多年坚守,押注物理AI原生的流式多模态未来
摘要
深度对话展现物理AI端侧多模态模型的路径选择与技术演进,信息密度高,对AI从业者有高参考价值。
- 发布时间
- 2026-07-13 13 天前
- 来源
- 36kr.com
- 字数
- 463
补充自 2026年07月14日
AI 摘要
正文
流式多模态模型VLX诞生源于反共识坚持:2019年,赵天成博士未追逐文本大模型或生成式AI热潮,选择“视觉+语言”的流式多模态路线。团队历经五年技术路线迭代,于2023年通过监控场景发现多模态训练的泛化优势,最终研发出全球首个面向物理AI的端侧流式多模态模型系列VLX。
VLX核心突破与定位:首次提出“端侧原生流式多模态”架构,在端侧打通“持续感知+精准定位+行动决策”的完整闭环。模型整合语义、几何、决策与预测四种能力,以Flow+Seek+Go三层能力在同一视频流上实现感知—定位—行动一体化,而非三个独立模型。
商业化落地与数据闭环:VLX已完成模型、数据、商业三个闭环。赋能摄像头、AI PC、无人机、机器狗等多类终端,从成熟硬件向新兴本体演进。百万级真实业务场景数据持续回流反哺模型,公司营收已达亿级规模。
行业节点与判断:2026年物理AI热度转向,一季度全球融资超64亿美元,路线仍呈寒武纪式爆发。赵天成认为物理AI需分布式端侧智能,原生视频流处理是其底层基础,单一模型或路线难以覆盖全部场景,产业生态协同是终局方向。
将生产AI智能体迁移至GPT-5.6:速度提升2.2倍,成本降低27%
摘要
一线实操经验,量化了模型升级对实际产品性能与成本的影响,参考价值高。
- 发布时间
- 2026-07-13 13 天前
- 来源
- ploy.ai
- 字数
- 486
补充自 2026年07月13日
AI 摘要
正文
Ploy 公司将其生产级 AI 智能体从 Claude Opus 4.8 迁移至 OpenAI 今日发布的 GPT-5.6 Sol 模型。经实际任务对比评测,GPT-5.6 Sol 在构建营销网站的完整流程中,平均完成耗时从 8 分钟降至 3 分 42 秒,速度提升约 2.2 倍,每次构建成本从 3.06 美元降至 2.22 美元,降低 27%,且输出令牌量减半,视觉评分从 0.936 升至 0.970。
迁移过程中暴露出评测体系对旧模型的隐性适配问题。初步跨模型测试中,约三分之一失败案例源于工具调用预算、批处理文件读取等测试工具假设,而非模型能力。修正后数据显示 GPT-5.6 Sol 倾向并行调用工具,而 Claude Opus 则为顺序模式。
工具调用行为差异显著。GPT-5.6 Sol 会为可选参数填充自创默认值,导致 52% 至 64% 的文件读取返回空结果。即便通过提示词、参数说明或严格模式尝试修正,该模型仍会传出全部 25 个属性,需从工具 schema 层面解决。
迁移过程包括四个步骤:修复评测工具、调整工具 schema、适配提示缓存以及处理推理回放。模型设计表现上,GPT-5.6 Sol 倾向于输出干净、现代但趋同的布局,需额外引导以保持品牌一致性。
实测对比:Claude Code 发送 3.3 万 Token 而 OpenCode 仅 7 千
摘要
针对主流 AI 编码工具的直接效率对比,数据扎实,对开发者有参考价值。
- 发布时间
- 2026-07-13 13 天前
- 来源
- systima.ai
- 字数
- 615
补充自 2026年07月13日
AI 摘要
正文
在相同模型、相同机器和相同任务下对比发现,Claude Code 的固定开销远超 OpenCode。仅要求回复“OK”时,Claude Code 的系统提示、工具模式和脚手架注入共消耗约 33,000 Token,而 OpenCode 仅约 7,000 Token。切换到 Claude Fable 5 模型时,因系统提示规模减小,差距缩窄到约 3.3 倍,表明开销倍数与模型相关。
缓存效率上差异更为明显。OpenCode 每次请求前缀字节完全相同,可一次写入缓存后低价读取;Claude Code 则在会话中反复重写大量缓存 Token,在同任务下写入的缓存 Token 最多可达 OpenCode 的 54 倍,这些高价缓存写入直接推高用量仪表盘数字。
实际生产配置会进一步膨胀请求。一份 72KB 的仓库指令文件平均增加约 20,000 Token 到每次请求,五个轻量 MCP 服务器再增加 5,000 到 7,000 Token。典型工作环境发送首个请求时,在用户未输入任何字符前已耗约 75,000 到 85,000 Token。子代理同样推高成本,一个小任务直接执行花 121,000 Token,分派给两个子代理后总消耗升至 513,000 Token,因为每个子代理自带启动开销,且父代理消耗其交互记录。
Claude Code 在多步任务中存在一项优势:通过将多个工具调用合并为较少请求,其任务总 Token 消耗可低于按回合反复支付较低基线的 OpenCode。整体开销起点更高,但会话展开方式决定最终谁消耗更多。
Anthropic回应Claude“变笨”争议:问题不在模型,而在参数设置
摘要
Anthropic官方亲自回应开发者困惑,提供了关于大模型使用的重要实操澄清,对AI从业者有直接指导价值。
- 发布时间
- 2026-07-12 14 天前
- 来源
- 36kr.com
- 字数
- 548
补充自 2026年07月13日
AI 摘要
正文
开发者社区曾普遍认为换用更强大的模型就能解决AI性能问题,这一误区导致大量Claude Code用户因模型“变笨”而投诉,甚至升级至最昂贵的Fable模型。Anthropic官方回应,问题根源不在模型本身,而在于Effort(努力度)参数的默认设置被下调。
Anthropic阐述了Model与Effort的明确分工:Model(如Sonnet、Opus、Fable)相当于更换“脑子”,封装了训练冻结的权重,决定模型“会不会”某项任务;Effort则代表工作“态度”,控制模型在任务中投入的工作量,例如是否主动读取文件、运行测试、进行多次验证或独立完成长任务链。
3月4日,Anthropic为降低延迟,将Claude Code中的Effort默认值从“high”调至“medium”,导致AI思考量骤降67%,频繁中断任务并向用户反问更多信息。在经历用户抗议后,Anthropic于4月7日恢复了默认设置并重置了用量额度。
该事件揭示了一个关键结论:在上下文充足的前提下,小模型配合高Effort(生成token量可比低Effort高约7倍)通常能胜过开低Effort的大模型。Anthropic建议,当Claude出错时,应先判断它是“不会”还是“不够努力”,再据此决定是换模型还是调高Effort。