OpenAI 于 2026 年 7 月 9 日发布 GPT-Live 系列全双工语音模型,包括 GPT-Live-1 和 GPT-Live-1 mini 两个版本,即日起向全球 ChatGPT 用户开放。其中 GPT-Live-1 面向 Go、Plus 和 Pro 订阅用户,免费用户可使用 GPT-Live-1 mini。
GPT-Live 系列采用全双工架构,可同时处理输入和输出,每秒多次判断是否说话、继续倾听、暂停、打断或调用工具,使对话更接近真人体验。面对复杂任务时,模型在前台维持语音对话流,同时将网页搜索、复杂推理等委托给 GPT-5.5 系列模型后台执行:GPT-Live-1 (instant) 和 GPT-Live-1 mini 调用 GPT-5.5 Instant;GPT-Live-1 Medium 调用 GPT-5.5 Thinking Medium;GPT-Live-1 High 调用 GPT-5.5 Thinking High。
在性能方面,OpenAI 建立了新的人工评测体系,重点考察舒适度和流畅性。相比 Advanced Voice Mode,在 5-10 分钟的配对对话中,GPT-Live-1 和 GPT-Live-1 mini 在整体偏好、轮次衔接、打断情况、对话流畅度等指标上得分更高。目前每周有超过 1.5 亿人通过 Voice 和 Dictation 等功能与 ChatGPT 语音交互,应用场景包括免手持协助、语言练习、睡前故事等。
新版本支持在语音对话中展示天气、股票、体育等可视化卡片,并继续支持搜索、记忆、图片和文件上传。安全方面,GPT-Live 在自伤、精神病症状、情感依赖、暴力及性内容等领域接受了音频原生评测、合成音频评测与内部红队测试,在几乎所有评估维度上与 Advanced Voice Mode 相当或更优。
AI 日报 · 2026年07月09日
2026年07月09日日报
今日 AI 日报总结:根据当期推送内容整理,推荐优先关注的方向与热点。向下滚动左侧列表可浏览近半个月往期。
今日导读
今日AI行业亮点:OpenAI发布GPT-Live系列全双工语音模型,支持实时对话,免费用户可用mini版; SpaceXAI推出Grok 4.5编程智能体,与Cursor联合训练,效率翻倍价格减半; 字节跳动发布Seedream 5.0 Pro多模态图像创作模型,支持复杂信息可视化与交互式编辑。 此外,GitHub Copilot新增Kimi K2.7模型支持,Google AI Studio上线GitHub导入功能,多项实用工具更新。
今日要点速览
点击左侧任意资讯,切换到具体文章阅读。
OpenAI 最智能语音模型:GPT-Live-1/mini 登场,边听边说让 AI 对话更接近真人聊天
摘要
全新语音模型大幅提升AI对话体验,是重要的AI产品发布,对从业者具有直接参考价值。
- 发布时间
- 2026-07-09 18 天前
- 来源
- ithome.com
- 字数
- 692
AI 摘要
正文
马斯克 SpaceXAI 首个编程智能体模型 Grok 4.5 发布:与 Cursor 联合训练,效率翻倍价格减半
摘要
首个编程智能体模型,性能与成本优势显著,对开发者是重大利好。
- 发布时间
- 2026-07-09 18 天前
- 来源
- ithome.com
- 字数
- 710
AI 摘要
正文
SpaceXAI 于2026年7月9日正式发布 Grok 4.5 模型,这是该公司首个专门针对编程和智能体任务训练的模型,由 SpaceXAI 与 Cursor 联合完成训练。马斯克将其称为“Opus 级模型”,在提供前沿智能水平的同时兼具领先的速度与成本效率。
Grok 4.5 面向真实工程场景设计,擅长处理大型代码库及跨多个仓库、涉及多种技能和工具的长时间任务。模型在数万个 NVIDIA GB300 GPU 上完成训练,团队在数据过滤与筛选上投入大量精力,通过去重、质量评分和领域聚焦筛选保证数据混合的高覆盖与高信号。强化学习阶段覆盖数十万个任务,重点围绕多步软件工程及其他技术工作。
Grok 4.5 在效率上表现出色:单个任务消耗的 Token 仅为同级领先模型的一半,每秒输出 Token 数达 80 TPS,单次任务步骤数少一半。定价为每百万输入 Token 2 美元(约13.6元人民币)、每百万输出 Token 6 美元(约40.8元人民币),成本不到同类可比模型的一半。
除代码生成外,Grok 4.5 还展现出 Office 工作场景能力:在 Grok Build 中可构建包含网络研究、多工作表公式的复杂 Excel 模型;在 PowerPoint 中能利用原生形状绘制复杂图表并设计幻灯片内容;在 Word 中可撰写清晰文章。模型还具备根据简单提示直接构建端到端功能应用的能力,在 Rust、C/C++ 等任务中均有高效表现。
即日起,Grok 4.5 在 SpaceXAI 控制台、Grok Build 以及 Cursor 中可用,所有使用限制已重置,用户可通过 x.ai/cli 免费开始使用。Grok Build 和 Cursor 将提供一段时间的免费用量。目前该模型尚未在欧盟地区开放,预计将于 7 月中旬上线。
字节发布多模态图像创作模型 Seedream 5.0 Pro:复杂信息可视化、交互式精准编辑
摘要
字节跳动最新多模态模型,在图文匹配和编辑能力上有重要突破,对AI创作者价值高。
- 发布时间
- 2026-07-08 18 天前
- 来源
- ithome.com
- 字数
- 329
AI 摘要
正文
字节跳动于2026年7月8日发布多模态图像创作模型Seedream 5.0 Pro。相比前代版本,该模型在图文匹配、结构合理性、文字渲染与画面美感等基础能力上实现全面提升。
Seedream 5.0 Pro的核心亮点包括:复杂信息可视化,能将数据、概念与密集文字准确转化为专业排版,直接用于高信息密度的内容生产;交互式精准编辑,基于对空间位置与区域语义的理解,支持点选、圈选、草图渲染、色彩与材质替换、图层分离、多图融合等可控编辑。
此外,该模型还实现了真实的影像与人像质感,还原现实世界的光影、材质与皮肤肌理;并支持十余种世界常用语言的直接输入与高质量渲染,准确传递本地化特征。
目前,Seedream 5.0 Pro已上线火山方舟体验中心,并将陆续在豆包、即梦等平台上线。
Google AI Studio Adds ‘Import from GitHub’ to Build Mode, Turning an Existing Repo Into an Editable, Deployable App
摘要
降低AI应用开发门槛,提升迭代效率,实用性强
- 发布时间
- 2026-07-09 18 天前
- 来源
- marktechpost.com
- 字数
- 598
AI 摘要
正文
Google AI Studio 在 Build 模式中新增了“从 GitHub 导入”功能,可将现有仓库转换为运行时兼容格式,并支持在 AI Studio 中进一步迭代和部署。该更新于 2026 年 7 月 8 日由 Google AI Studio 官方账号和产品负责人 Logan Kilpatrick 宣布。
Build 模式是 AI Studio 的“vibe coding”界面,用户通过提示描述应用,Gemini 即可生成全栈应用并提供实时预览,随后可通过聊天或注释模式进行完善。新功能为这一流程提供了新起点:用户可指向 GitHub 仓库,AI Studio 自动将其转换为兼容格式,然后进行迭代和部署。
导入流程包括三个步骤:导入仓库、在 AI Studio 中迭代、部署。对于使用 Gemini API 的应用,AI Studio 会将 GEMINI_API_KEY 配置为服务器端密钥,确保密钥不会出现在客户端代码中。示例中强调,应通过服务器端环境变量调用 API,而非在浏览器中直接暴露密钥。
该功能可用于多种场景:复活 hackathon 旧项目(导入后添加新功能并部署)、快速引导团队成员(导入公共仓库并生成预览链接)、或将小型原型转化为完整应用。与其他工作流(如推送到 GitHub、下载 ZIP、从应用画廊复刻)不同,此次新增了从 GitHub 导入的路径,弥补了此前 Build 模式缺少的输入方向。
需要注意的是,目前精确的运行时格式、私有仓库支持以及同步行为等细节尚未公布。
Ant Group’s Robbyant Open-Sources LingBot-Vision: A 1B Boundary-Centric Vision Foundation Model for Dense Spatial Perception
摘要
开源视觉模型,边界建模创新有研究价值
- 发布时间
- 2026-07-08 18 天前
- 来源
- marktechpost.com
- 字数
- 669
AI 摘要
正文
蚂蚁集团旗下具身智能公司 Robbyant 开源了 LingBot-Vision,一个自监督视觉 Transformer 系列模型,专为密集空间感知设计。模型权重以 Apache-2.0 许可证发布在 Hugging Face 上,包含 ViT-giant(约 1.1B 参数)、ViT-large(300M)、ViT-base(86M)和 ViT-small 四种尺寸,同时提供技术报告和推理代码。
LingBot-Vision 的核心创新在于将物体边界作为原生预训练信号,而非仅作为下游任务输出。其训练方法“掩码边界建模”基于 DINO/iBOT 自蒸馏范式:教师网络在线预测密集边界场并识别边界令牌,强制将这些边界令牌加入学生的掩码集;同时边界令牌除语义自蒸馏目标外,还附加几何目标,内点令牌则仅保持标准语义目标。边界场被离散化为 32 个箱体的分类任务,并利用 a-contrario 假设检验(NFA)自动验证解码段,避免伪结构传播。训练使用约 1.61 亿张图像(选自 20 亿池),无人工标注、外部边缘检测器或预训练骨干启动。
性能方面,LingBot-Vision ViT-g 在 NYUv2 深度估计上以 0.296 的 RMSE 超越 7B 参数的 DINOv3(0.309),在 KITTI 上也是 2B 参数以下最佳模型。语义分割中,与经蒸馏的 DINOv3 ViT-H+ 相当(ADE20K 低 1.3 mIoU,Cityscapes 持平,VOC12 领先)。视频目标分割在 DAVIS-2017 达到 70.0 J&F,与 7B DINOv3(71.1)接近,为所有较小模型中最佳。所有结果均使用冻结特征加单线性层读出,归因于表示本身而非解码器。
NVIDIA Releases Audex (Nemotron-Labs-Audex-30B-A3B): A Unified Audio-Text LLM That Preserves the Text Intelligence of Its Backbone
摘要
多模态音频模型统一能力强,技术前沿
- 发布时间
- 2026-07-08 19 天前
- 来源
- marktechpost.com
- 字数
- 673
AI 摘要
正文
NVIDIA发布了Audex(Nemotron-Labs-Audex-30B-A3B),一个统一的音频-文本大语言模型,能够理解和生成音频与语音,同时保持其文本骨干的智能。该模型以非商业许可发布,还包括较小的Audex-2B模型。
Audex是一个30B参数的MoE(混合专家)Transformer解码器,每token激活3B参数,骨干为Nemotron-Cascade-2-30B-A3B。设计简单:音频输入编码后投影到文本嵌入空间,文本和音频token在生成时统一处理。训练采用多阶段SFT和文本仅Cascade RL,避免了常见多模态模型的文本回归。训练数据包含1574亿音频token和3205亿文本token,任务涵盖ASR、AST、TTS、文本到音频和音频理解。
在文本基准上,Audex与骨干紧密匹配:MMLU-Redux得分86.4(骨干86.3),IMO AnswerBench 81.1(骨干79.3)。语音识别方面,在OpenASR榜单上平均词错误率6.82,领先Step-Audio-R1.1-33B和Qwen3-Omni-30B-A3B-Thinking。音频理解上,在MMAU领先,但在MMAR和MMSU上落后于最强模型。Audex还能生成通用音频(非语音),这是其他领先开源模型无法做到的。
应用场景包括多语言呼叫中心的转录与翻译、辅助技术的文本转语音、声音设计原型以及语音助手。支持指令模式和思考模式,上下文长度达100万token。例如,德语电话转录并翻译成英语;固定语音文本转语音的Seed-TTS-Eval英语词错误率仅1.70;根据描述生成10秒音频片段。
sqlite-utils 4.0, now with database schema migrations
摘要
知名开发者工具重大版本更新,实用性强,对数据库操作效率提升显著。
- 发布时间
- 2026-07-08 19 天前
- 来源
- simonwillison.net
- 字数
- 715
AI 摘要
正文
2026年7月7日,sqlite-utils 4.0正式发布,这是自2020年11月3.0以来的首个大版本(第124个版本)。该版本引入三项重要新特性:数据库模式迁移、嵌套事务(通过新方法 db.atomic())以及复合外键支持。此外,还包含一些小的破坏性变更(详见升级指南)。
数据库迁移功能允许用户通过Python文件定义一系列模式变更,并自动跟踪哪些迁移已被应用。迁移依赖 sqlite-utils Python 库的 table.transform() 方法,该方法通过创建临时表、复制数据、删除旧表并重命名的方式实现SQLite原生ALTER TABLE无法支持的增强操作。
示例迁移文件包含三个步骤:创建creatures表、添加weight列、修改species和weight的列类型。执行后,系统自动生成 _sqlite_migrations 表记录已应用的迁移。用户可通过命令查看迁移列表(包括已应用和待应用的)。若不指定迁移文件,sqlite-utils 会自动扫描当前目录下的 migrations.py 文件并应用其中的 Migrations 实例。
迁移设计参考了Django的迁移系统,但更简单:无需自动生成(因sqlite-utils采用编程式建表而非ORM),且不提供回滚功能(建议通过备份数据库文件实现)。该功能最初作为独立包 sqlite-migrate 发布(已多年未更新),现被合并到 sqlite-utils 核心中,使其默认可用,从而服务于sqlite-utils/Datasette/LLM生态系统。
版本4.0还对事务处理进行了大幅改进,解决了长期存在的混乱关系,使迁移系统更安全。现有依赖 sqlite-migrate 的项目无需改动即可继续工作。
MadsLorentzen/ai-job-search
摘要
实用AI求职工具,直接面向AI从业者。
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 529
AI 摘要
正文
MadsLorentzen/ai-job-search 是一个基于 Claude Code 的开源 AI 求职申请框架。它利用 Claude 评估职位匹配度、定制简历、撰写求职信并准备面试,工作流程包括自我画像、适配评估以及起草-审核应用管线。该框架语言和国家通用,但职位搜索技能目前针对丹麦市场(Jobindex、Jobnet、Akademikernes Jobbank 等),用户可替换为本地招聘平台。
项目依赖 Claude Code CLI、Python 3.10+、Bun 以及 LaTeX 发行版(TeX Live 或 MacTeX 等),并可选安装 pdftotext 用于 ATS 解析检查。快速使用步骤:Fork 并克隆仓库,安装各个搜索工具的 CLI 依赖,然后通过 Claude Code 运行 /setup 设置个人资料(可从文档文件夹导入或逐步填写),使用 /scrape 搜索职位并查看按适配度排序的结果,最后通过 /apply 对特定职位生成完整申请材料。
框架还提供扩展命令:/interview 为面试准备阶段预案,/outcome 记录申请结果并校准画像,/rank 批量评分新抓取的职位并生成候选名单,/expand 从已关联的公开来源扩充个人资料。注意该项目是独立开源项目,与 Anthropic 无关联。
diegosouzapw/OmniRoute
摘要
实用免费网关,节省成本,提升效率。
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 682
AI 摘要
正文
OmniRoute 是一个免费的 AI 网关,通过单一端点连接 237 个提供商(其中 90 多个免费),支持 Claude Code、Codex、Cursor、Cline、Copilot、Antigravity 等 24 多种 AI 编码代理。它提供自动故障转移功能,当配额用尽时毫秒级切换到下一个提供商,实现零停机;并采用 RTK + Caveman 压缩技术,在工具密集型会话中平均节省约 89% 的 token(范围 15–95%)。
该平台聚合了 40 多个提供商池/500 多个模型的公开免费额度,每月稳定提供约 16 亿免费 token,首月通过注册奖励可达约 21 亿。另有永久免费且无上限的提供商(如 SiliconFlow、Z.AI GLM-Flash、Kilo、OpenCode Zen 等)以及 10 美元 OpenRouter 充值可额外获得每月 2400 万 token,这些不计入主数字以避免夸大。用户可通过仪表盘实时查看每个模型的已用/剩余配额及提供商条款。
OmniRoute 提供 17 种路由策略,包括优先级、填充优先、加权随机、轮询、最少使用、成本优化、头部空间等,并可组合使用。其“自动”模式会根据连接提供商动态构建虚拟组合,优化延迟、成本、配额等。还支持 MCP(95 种工具)、A2A、记忆、护栏、评估等生产级功能,并具有 TLS 指纹隐身和三级代理,可在受限地区使用。
服务完全免费使用,无需信用卡,有 11 个永久免费提供商。用户只需将工具配置为指向 http://localhost:20128/v1 即可自动工作。项目在 GitHub 上开源,支持 42 种语言,并提供 Discord、Telegram、WhatsApp 社区支持。
TencentCloud/TencentDB-Agent-Memory
摘要
重要AI Agent记忆方案,技术领先。
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 569
AI 摘要
正文
TencentDB Agent Memory 是腾讯云推出的一种智能记忆系统,旨在帮助智能代理(Agent)记住工作流程、任务上下文和过往经验,从而减少人类重复说明的需要。该系统由符号短期记忆和分层长期记忆两大核心技术构成。
符号短期记忆通过将繁重的工具日志压缩成紧凑的 Mermaid 符号图,大幅降低 Token 使用量并提升任务成功率。分层长期记忆则将零散的对话提炼为结构化的角色(Persona)和场景(Scenario),而非扁平化的向量堆叠。
与 OpenClaw 集成后的测试表明,该系统在持续长会话场景中表现优异:Token 使用量最多降低 61.38%(WideSearch 任务),任务的通过率相对提升 51.52%,PersonaMem 记忆准确率从 48% 提升至 76%。其他指标如 SWE-bench(通过率 +9.93%、Token -33.09%)和 AA-LCR(通过率 +7.95%、Token -30.98%)也均有显著改善。
核心架构包括记忆分层和符号记忆。记忆分层实现渐进式披露:短期上下文分为底层(原始日志)、中层(步骤摘要)和顶层(Mermaid 画布);长期个性化分为 L0 对话→L1 原子事实→L2 场景→L3 角色;技能生成也采用类似分层。符号记忆通过 Mermaid 符号图、历史卸载(文件存储)和 node_id 追踪,在保持最小上下文的同时确保全链路追溯能力。
alibaba/page-agent
摘要
实用网页AI代理工具,集成简便。
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 431
AI 摘要
正文
Page Agent 是一个运行在网页中的 GUI Agent,只需一行 JavaScript 脚本即可为任意网页添加 AI 代理能力,无需安装浏览器扩展、Python 或无头浏览器,所有操作在页面内完成。
它基于文本的 DOM 操作,不依赖截图或多模态大模型,支持主流 LLM(包括本地部署模型),并可选 Chrome 扩展实现多页面任务。主要用例包括:SaaS AI Copilot(几行代码集成)、智能表单填写、无障碍访问(语音控制)、多页面代理等。
快速集成方式:通过 CDN 引入 script 标签(https://cdn.jsdelivr.net/npm/page-agent@1.11.0/dist/iife/page-agent.demo.js)或 npm 安装(npm install page-agent),然后实例化 PageAgent 并设置模型接口。支持全局 CDN 和国内镜像。
该项目基于 MIT 许可证,借鉴了 browser-use 项目的 DOM 处理组件。欢迎社区贡献,但拒绝无人工参与的纯 AI 生成贡献。
lessweb/deepcode-cli
摘要
实用的AI编码工具,提升开发效率。
- 发布时间
- 今日收录
- 来源
- github.com
- 字数
- 593
AI 摘要
正文
Deep Code CLI 是一款专为 deepseek-v4 模型优化的终端 AI 编码助手,支持深度思考、推理强度控制、Agent Skills 以及 MCP 集成。通过 npm install -g @vegamo/deepcode-cli 安装,在项目目录运行 deepcode 即可启动。配置 ~/.deepcode/settings.json 文件,与 Deep Code VSCode 插件共享配置。
主要功能包括 Skills(支持项目级和用户级自定义 skills 目录)、斜杠命令(如 /new 开始新对话、/model 切换模型、/skills 列出可用 skills)和按键操作(Enter 发送、Ctrl+V 粘贴图片等)。支持的模型包括 deepseek-v4-pro(推荐)、deepseek-v4-flash 以及任何 OpenAI 兼容模型。
Deep Code 的架构专为 DeepSeek 量身调优,通过工具约束、上下文管理、Agent Skills 和权限策略等设计提升效果。基准测试显示,Deep Code + DeepSeek + /plan 模式在真实 Python 需求上优于 Claude Code + DeepSeek 组合。
常见问题:Deep Code 提供 VSCode 插件;支持多模态图片输入(推荐 Doubao-Seed-2.0-pro 模型);可配置 MCP 连接外部服务;支持细粒度权限控制(始终允许、询问或拒绝);支持 Coding Plan(设置 OpenAI 兼容接口即可)。
2026年大模型API免费额度盘点:14个平台薅羊毛指南,看这篇就够了-CSDN博客
摘要
对开发者极其实用,节省成本,信息全面且时效性好。
- 发布时间
- 2026-07-03 24 天前
- 来源
- blog.csdn.net
- 字数
- 484
补充自 2026年07月08日
AI 摘要
正文
自2025年下半年起,国内大模型厂商展开“免费额度军备竞赛”,DeepSeek V4预览版上线(100万上下文,价格降幅73%)。本文盘点14个平台的免费额度,帮助用户分辨真伪与限制条件。
国内平台方面:智谱AI新用户赠送2000万Token(永久有效),GLM-4-Flash完全免费;硅基流动新用户2000万Token,9B以下模型永久免费;阿里百炼每个模型100万Token(有效期3个月);火山引擎每天200万Token(按天重置);百度智能云千帆的ERNIE-Speed-8K永久免费(QPS 50);Kimi开放平台赠送15元代金券(永久有效);腾讯云混元通用资源包100万Token(有效期1年);科大讯飞星火每个模型20万Token。
国际平台方面:Google Gemini免费层每天1440次请求(Gemini 2.5 Flash),百万上下文窗口,永久有效;OpenAI新用户$5试用额度;Claude新用户$5额度(30天有效);NVIDIA NIM APIs无限调用次数(默认40 RPM)。需要注意,所有免费额度均有速率限制,建议实现指数退避重试机制以避免429错误。
2026年AI大模型天选时刻:9款爆款模型深度评测,助你精准锁定理想AI助手!_月之暗面公司kimi2026-CSDN博客
摘要
系统性对比,帮助用户按需选择,实用性强。
- 发布时间
- 2026-07-04 23 天前
- 来源
- blog.csdn.net
- 字数
- 668
补充自 2026年07月08日
AI 摘要
正文
文章对9款主流AI大模型(Kimi、DeepSeek、Qwen、豆包系列、GLM、Gemini、Claude、ChatGPT、MiniMax)进行了深度评测,从定位、用法、优缺点及成本角度全面对比。文章指出,2026年AI大模型已进入精细化发展阶段,用户需根据自身需求选择最适配的模型。
各模型核心信息如下:
- Kimi(月之暗面):原生多模态+智能体集群,200万token上下文,最新K2.5版本于2026年1月27日在Modified MIT许可证下全面开源,个人版免费额度足够,专业版按次收费。
- DeepSeek(深度求索):性价比天花板,主打数学和代码双优势,开源版本完全免费,闭源版API价格极低,适合程序员、科研人员和中小企业。
- Qwen(阿里千问):国产全能王,最新Qwen 3.5-Plus为原生多模态模型,2026年2月16日开源,中文理解顶尖,个人版完全免费,企业API价格合理。
- 豆包系列(字节跳动):普通用户的最佳AI搭子,最新豆包2.0 Pro主打通用Agent能力,个人版完全免费,零门槛语音交互。
- GLM(智谱):企业和专业人士的得力助手,逻辑推理和编程能力顶尖,支持开源商用,适合复杂任务处理。
- Gemini(谷歌):多模态处理领先,能处理视频、超长文本,API价格极低,但国内使用有地域限制。
- Claude(Anthropic):严谨派专业助手,代码能力顶尖,Claude Code工具适合工程级开发,需付费使用。
- ChatGPT(OpenAI):AI行业标杆,通用能力强,生态完善,迭代快,个人版有免费额度,企业API按量计费。
Trae自定义模型接入全教程:5分钟接入DeepSeek、GLM、Qwen,打造专属AI编程助手_trae接入千问-CSDN博客
摘要
具体操作教程,提升AI编程工具实用性,对开发者有直接帮助。
- 发布时间
- 2026-07-04 23 天前
- 来源
- blog.csdn.net
- 字数
- 314
补充自 2026年07月08日
AI 摘要
正文
Trae是一款轻量化AI编程工具,出厂默认搭载豆包系列代码模型。为满足不同开发场景需求(如复杂算法推理、超长上下文阅读、中文需求策划),Trae支持自定义大模型接入,无需代码开发,仅需API密钥与接口地址,5分钟即可完成配置。
主要可接入的模型包括:DeepSeek(擅长数学运算、逻辑推导、算法调试)、智谱GLM(超大上下文窗口,适合大型工程梳理)、通义千问Qwen(中文对话与文档撰写表现优秀),以及本地Ollama私有模型。用户可根据工作场景随时切换,且自有模型API额度可复用,降低使用成本。
接入前需准备两项必备条件:有效的API密钥和目标模型的接口地址。具体操作流程包括快捷切换、手动自定义、本地模型部署及常见报错排查。
trae 常见问题_trae 老是提示运行命令 加到白名单-CSDN博客
摘要
面向AI开发者,解决实际使用问题,提升编程效率。
- 发布时间
- 2026-07-04 23 天前
- 来源
- blog.csdn.net
- 字数
- 51
补充自 2026年07月08日
AI 摘要
正文
正文暂无法抓取(如微信验证页拦截),请点击上方「查看原文」。
Meta 超级智能实验室首个自研 AI 图像生成模型 Muse Image 发布,免费登陆 Instagram 与 WhatsApp
摘要
面向普通用户的实用AI模型,免费且集成社交平台,使用门槛低,信息价值高。
- 发布时间
- 2026-07-08 19 天前
- 来源
- ithome.com
- 字数
- 659
补充自 2026年07月08日
AI 摘要
正文
Meta于2026年7月7日发布其AI图像生成模型Muse Image,该模型出自Meta超级智能实验室,是其首个自研图像生成模型。目前通过Meta AI应用免费提供,并同步登陆Instagram和WhatsApp。用户可通过对话式语言描述需求生成高质量图像,支持模拟人物站在历史地标前、擦除照片背景、生成自定义二维码等功能,还能在画面中清晰渲染文字。
为降低使用门槛,Meta AI内置预设提示面板,提供一键修复老照片、查看不同发型效果、将自拍转为黏土动画或游戏英雄形象等预制提示。拍照后还可让AI用Facebook Marketplace中的真实商品重新设计房间,查看不同风格效果。Muse Image与Muse Spark配合,进行多步骤幕后规划,包括布局安排、实时网页信息检索及融合多个视觉参考。
用户可在Meta AI应用中@提及Instagram账户,将公开照片融入创作(可关闭)。修改时可通过点击标记图标在图像上圈画、草绘或批注,AI会记住对话语境以便持续调整。此外,Muse Image为Instagram Stories提供超过30种AI特效。WhatsApp中与Meta AI直接对话生成图像功能已在部分国家上线,日常创作免费但超出额度需订阅。
未来Muse Image将拓展至Facebook、Messenger等平台,广告主可在接下来几周通过Advantage+ creative调用该模型。Meta同时透露另一款Muse Video视频生成模型已在开发中。过去一年,Meta发布了多项AI应用和服务,并持续扩建AI基础设施。
超 90% 使用非代码开发,Claude Cowork 扩展至网页与手机端
摘要
AI智能体落地实用场景,展示AI在日常工作中的价值。
- 发布时间
- 2026-07-08 19 天前
- 来源
- ithome.com
- 字数
- 541
补充自 2026年07月08日
AI 摘要
正文
Anthropic 于 7 月 7 日发布公告,宣布 Claude Cowork 开始扩展到网页端和移动端,用户可在不同设备之间延续会话与文件操作。Claude Cowork 是 Anthropic 推出的一项任务智能体,可跨文件、日历、电子邮件、消息应用、网页等工具执行任务,直至完成既定目标,适用于资料整理、文档起草、客户准备等知识型工作场景。
据官方披露,在 Claude Cowork 的使用场景中,超过 90% 并非用于开发软件,而是主要用于日常知识型工作。其中业务运营和内容创作是占比最大的两类,合计约占全部使用量的约 50%,涉及支出核对、差异备忘录撰写、合同续签追踪表整理以及客户材料整理等任务。
本次版本更新后,Cowork 支持跨设备延续任务:用户可在桌面端发起任务,通过手机查看进度,并在任意设备上接收完成结果。此外,定时任务现在可在无设备在线的情况下运行,例如将周一客户准备工作设定在 6 时启动,Claude 会自动读取邮件线索、通话记录和近期新闻,生成简报文档,并草拟后续邮件。涉及关键决策时,Claude 仍会向用户发起确认,请求可发送至手机端,相关内容在用户审阅并批准前不会发出。
网页版和移动端 Claude Cowork 目前仍处于测试阶段,首批面向 Max 用户,官方表示将在未来几周分批邀请更多用户测试。
Why the rise of open source AI isn’t hurting Anthropic … yet
摘要
提供AI生态的深度分析,有助理解竞争格局。
- 发布时间
- 2026-07-08 19 天前
- 来源
- techcrunch.com
- 字数
- 466
补充自 2026年07月08日
AI 摘要
正文
Decagon CEO Jesse Zhang提出新理论,认为开源AI与企业级前沿模型并非直接竞争,而是同一生命周期中的不同阶段:企业先用前沿模型验证用例,成熟后再转向更便宜的开源替代品。尽管更多成熟用例转向轻量模型,但前沿模型的总支出几乎未下降,因为新用例不断涌现。
数据支持这一观点:Vercel的AI网关仪表盘显示,DeepSeek在token处理量上领先(占三分之一以上),但按总支出计,Anthropic仍占平台AI支出的一半以上。OpenRouter数据类似,DeepSeek V4 Flash周处理5.3万亿token,而前沿模型Opus 4.8仅2万亿,但Opus的token单价是DeepSeek的约23倍,因此捕获了大部分支出份额。
前沿实验室未受开源浪潮显著冲击,原因有二:市场增长迅速,前沿模型通过主导早期部署维持地位;许多用例过于复杂,无法完全用廉价替代品替代。这种“前沿发现、开源生产”的双层模型经济可能成为常态。
未来,前沿提供商可能继续占据“优质token”价格市场,而开源模型则在量化生产中扩大份额,两者将长期共存。
Claude Code v2.1.202 发布
摘要
这波修复让远程控制和工作流终于稳了,以前被 silent drop 的文件和无线重试的 bug 都治好了,Claude Code 重度用户升级后体验会好一个档次。
- 发布时间
- 19 天前
- 来源
- github.com
- 字数
- 1,061
补充自 2026年07月07日
AI 摘要
正文
变更内容
在 /config 中新增了“动态工作流大小”设置,用于控制 Claude 通常构建动态工作流的规模(智能体数量为小/中/大)——这是一项建议性指导,而非强制上限。
为工作流生成的智能体所发出的遥测数据添加了 workflow.run_id 和 workflow.name 这两个 OpenTelemetry 属性,从而可以通过 OTel 数据重构工作流运行的活动记录。
修复了在行内 Ctrl+R 历史搜索中,当搜索仍在扫描历史文件时接受或取消操作会导致崩溃的问题。
修复了在后台会话上执行 /rename 操作后,当任务重启时重命名被还原,导致无法通过新名称寻址该会话的问题。
修复了在客户端证书原地轮换期间,当设置被重新应用时出现的短暂 mTLS 握手失败问题。
修复了从远程控制(手机/网页)发送到交互式会话的命令提示“未知命令”失败的问题。
修复了从远程控制移动端或网页应用发送的不带说明的图片和文件被静默丢弃的问题。
修复了由 claude auth login 和 claude mcp login --no-browser 打印的登录 URL 在通过 SSH 换行时无法可靠点击的问题——现在该 URL 以单个超链接形式输出。
修复了从 claude agents 打开聊天时有时会提示“当前正在作为后台智能体运行”并随后导致工作进程崩溃/重启循环的问题。
修复了工作流脚本中字符串包含 Unicode 引号转义时在解析前被损坏的问题;现在工作流解析错误会显示有问题的行,而非总是将原因归咎于 TypeScript。
修复了当麦克风或录音器失败时语音听写陷入无限循环重试的问题——重复的捕获失败现在会暂停语音输入。
修复了 /remote-control 会话在移动端和网页应用中显示错误的权限模式的问题。
修复了通过名称恢复会话,或打开恢复选择器时,在拥有大量 git 工作树的仓库中需要数分钟并消耗大量内存的问题。
修复了当代理或网络在下载中途断开连接时,安装程序和更新程序立即提示“已中止”下载失败的问题——短暂的连接断开现在会进行重试。
修复了重新调用一个已加载的技能会向上下文中追加其指令副本的问题。
改进 /workflows agent 列表布局:更宽的标题、专门的时间列、更短的模型名称,并且不再显示每行的工具调用次数。
改进 MCP 错误信息:当服务器配置包含 url 但缺少 type 时,错误信息更清晰,建议使用 "type": "http" 来代替误导性的 "command: expected string"。
将 /review 改回快速单次审查;使用 /code-review 进行多智能体审查,并可选择投入力度。