AI 新闻列表
收录模型发布、产品更新、行业动向和 AI 工具生态消息,适合每天快速浏览。
OpenAI 为 GPT-5.5 推出生物安全 Bug Bounty
OpenAI 宣布面向 GPT-5.5 的 Bio Bug Bounty,邀请研究人员测试和强化高级 AI 生物能力相关安全防护,申请窗口开放至 2026 年 6 月 22 日。
OpenAI最新资讯
36 条GPT-5.6 接入 Kiro:开发任务成本效益提升
OpenAI 宣布 GPT‑5.6 系列已接入 AWS 的 Kiro 软件开发智能体,涵盖 Sol、Terra 和 Luna,可用于需求规划、编码、审查与测试。Kiro 以规格驱动方式结合需求、技术设计、代码库和团队规范,为多步开发任务提供结构化上下文。双方测试显示,GPT‑5.6 Terra 在 Terminal-Bench 2.1 中通过 Kiro 完成成功任务的成本约降低 82%。
OpenAIDeepMind 前成员创办的 Inherent 发布科研智能体 Faraday
英国 AI 实验室 Inherent 发布科研智能体 Faraday,称其可在未预先获知答案的情况下独立复现已发表论文的研究结果。该系统基于仅 270 亿参数的 Qwen 3.6,并以强化学习培养实验选择与设计能力;公司表示,它在这项特定任务上胜过 Claude Opus 4.8 和 GPT-5.5,长期目标是让智能体参与跨学科科学发现。
TechCrunchGoogle DeepMind 回顾 15 年游戏 AI 研究:从 Atari 到 EVE Online
Google DeepMind 回顾游戏如何推动其 15 年 AI 研究:从 DQN 学会 49 款 Atari 游戏,到 AlphaGo、AlphaZero、MuZero 和 AlphaStar,再到由 Gemini 驱动、可看懂画面并按自然语言操作键鼠的通用游戏智能体 SIMA 2。团队还与 EVE Universe 开发商 Fenris Creations 等工作室合作,用可玩原型探索自适应 NPC、AI 伙伴和游戏测试等新体验。
Google DeepMind语音识别榜单可能被“刷分”:新研究揭示基准优化现象
Hume AI 团队在 Hugging Face 发布研究,以三类测试评估 11 个常用开源语音识别模型。结果显示,部分高分模型会在音频与参考文本冲突、数字被静音或拼写存在多种形式时,复现公开基准的预期答案;这种行为在新采集音频上减弱。研究建议选型时采用完全留出的评测集,不应只看单一公开基准的词错误率,并已将相关分析加入 Open ASR Leaderboard。
Hume AI / Hugging FaceLiquid AI 发布 LFM2.5-DSpark:推理速度最高提升 3.2 倍
Liquid AI 为 LFM2.5-1.2B-Instruct、2.6B 和 8B-A1B 发布 DSpark 草稿模型检查点,以推测解码在不改变贪婪解码输出质量的前提下加速生成。官方测试显示,单张 H100 吞吐最高提升 3.18 倍,M4 Max 端侧最高提升 2.87 倍;2.6B 模型的多工具调用延迟平均降低 57%。检查点提供 Safetensors 与 GGUF 格式,并已支持 llama.cpp 和 SGLang。
Liquid AI / Hugging FaceLiquid AI 发布 LFM2.5 QAD 四位量化模型:恢复约 97% BF16 性能
Liquid AI 发布 LFM2.5 系列四款 QAD Q4_0 GGUF 检查点,覆盖 2.3 亿至 26 亿参数模型。它们通过量化感知蒸馏,在保持原生 Q4_0 低内存与高吞吐的同时,恢复约 97% 因量化损失的 BF16 平均准确率。官方称,小模型在同等质量下解码速度提升 4%–33%,可直接通过 llama.cpp 等支持 GGUF 的运行时使用。
Liquid AI / Hugging FaceSentence Transformers 6.0 新增多向量检索,统一支持 ColBERT 与视觉文档搜索
Hugging Face 发布 Sentence Transformers 6.0,引入 MultiVectorEncoder,为 ColBERT 式后期交互检索提供统一接口。它可直接加载 PyLate、Stanford ColBERT 及部分 ColPali 检查点,支持文本、图像、音频和视频检索,并兼容多种向量数据库。多向量方法保留逐 token 表示,检索更精准,但索引体积更大;官方同时给出压缩、池化及两阶段重排方案。
Hugging FaceOpenAI:AI 安全防守的关键窗口已经开启
OpenAI 指出,AI 正在同时提升攻击者自动化漏洞发现与利用的能力,也为防守方提供修复工具。官方披露其以 Codex 审查代码、让模型持续分流安全告警并探测潜在攻击路径,同时继续强化最小权限、网络隔离等基础控制。文章建议组织尽快为安全团队配备智能体,从只读扫描和人工决策起步,逐步用于漏洞排序、补丁生成、CI 审查及事件调查。
OpenAIChatGPT 推出“电脑历史”功能:记录点击与键盘操作,辅助续接任务
OpenAI 在 ChatGPT 的 macOS 桌面应用中加入可选的“电脑历史”功能。它会把鼠标点击和键盘操作整理成时间线,供 ChatGPT 与 Codex 查询,以了解用户工作方式、建议自动化,并续接未完成任务。用户可排除特定应用和网站、删除单条记录;无痕或隐私标签页会被自动忽略。OpenAI 称该功能不采集图像、视频或音频,而是依赖操作事件。
The VergeAnthropic 详解 Claude 文本水印:不含隐藏字符,不增加成本
Anthropic 解释未来 Claude 模型的文本水印机制:它通过调整模型在意义相近词语间的随机选择,在输出中形成只有持密钥者可检测的统计模式,不插入隐藏字符,也不增加 token、成本或携带用户身份信息。官方称此举是为遵守欧盟《人工智能法案》,但文本经大幅改写后水印可能变弱。
AnthropicGoogle 发布 Gemini 3.7 Flash:编程与智能体能力显著提升
Google 发布 Gemini 3.7 Flash,重点提升编程、智能体与复杂知识工作能力。官方称其代码调试、首次生成准确率及多步工具调用均优于 3.6 Flash;开发者现可通过 Gemini API、AI Studio、Android Studio 和 Antigravity 使用。年内优惠价为每百万输入 0.75 美元、输出 3.75 美元,Gemini Spark 也已切换至该模型。
Google DeepMindOpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 最高提速 14 倍
OpenAI 宣布预览 Ultrafast 模式,这是一个新的 API 服务层,可让 GPT-5.6 Sol 以最高 14 倍速度运行,并实现最高每秒 750 个输出 token。该模式由 Cerebras 提供支持;官方此次披露的核心更新,是在 API 中为 GPT-5.6 Sol 提供更高速度的推理选择。
OpenAIGoogle DeepMind 推出 SL2T,让手语直接转为文字
Google DeepMind 推出大规模多语言手语转文本模型 SL2T,使用超过 50 种手语、10 万小时以上数据训练,并以人体姿态坐标而非原始视频进行云端翻译。该模型已在 Pixel 11 的 Gboard 与“即时转写”中支持美国手语转英语,可用于搜索、撰写信息或与 Gemini 交互;官方称更多设备和语言将陆续加入。
Google DeepMindGoogle AMIE 医疗 AI 实现实时视频问诊
Google 推进医疗研究系统 AMIE,使其可进行实时视频问诊。该系统基于 Gemini 与 Project Astra,采用多智能体架构,可理解视听线索、引导虚拟体格检查并实时进行诊断推理。在由患者演员和基层医生参与的模拟随机研究中,临床评估者在病史采集、诊断准确性、处置适当性和沟通质量等方面给予 AMIE 积极评价;Google 强调它仍是研究系统,实际临床部署前还需更多研究。
GoogleMeta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型
Meta 发布 Muse Glimmer,一款由 Muse 蒸馏而来的 300 亿参数稠密多模态模型,采用 Apache 2.0 许可证,面向本地、注重隐私的智能体应用。模型可处理文本、图像和视频,支持多模态工具调用;Hugging Face 已同步提供 Transformers、llama.cpp、vLLM 与 Inference Endpoints 支持,并给出推理、微调及智能体接入示例。
Hugging Face / MetaAnthropic 将于 8 月 14 日起默认启用 Claude Code 自动模式
Anthropic 将从 8 月 14 日起,为 Claude Code 的 Pro、Max 和 Team 账户默认开启自动模式。该模式不再逐步请求人工批准,除非操作被判定为不可逆、破坏性或针对用户环境之外。公司称,在 1,053 名付费测试者参与的研究中,自动模式识别出 89% 的有害操作,高于人工审查的 13.6%;同时新增提示词注入筛查和可自定义的强制拒绝规则。
TechCrunchTutorMoments:AI 导师知道何时帮忙、何时放手吗?
艾伦人工智能研究所推出 TutorMoments 预览版,用真实一对一数学辅导记录评估大模型何时应提供支架、何时应让学生独立思考。初步测试显示,仅要求模型“好好辅导”时,它们往往帮助过度、较少推动深入推理;明确写出两者取舍虽能改善表现,但仍未解决问题。团队同时开放去标识化数据集、评测代码和模型回放结果。
Ai2(艾伦人工智能研究所)OpenAI:Astra 或已逼近“关键”网络能力门槛
OpenAI披露,即将推出的Astra在近期内部评测中展现显著的智能体编程和网络安全进步,暂无法排除其达到“关键”网络能力门槛。公司已加强安全控制,包括隔离测试、限制网络与工具访问、强化权重保护和监控,并暂停不符合新要求的内部活动;后续还将与政府机构及部分AI安全组织联合测试。
OpenAIBaseten 接入 Hugging Face Inference Providers:开放模型调用更便捷
Hugging Face 宣布将 Baseten 接入 Inference Providers,用户可直接在模型页面、Python 与 JavaScript SDK,以及 Pi、OpenCode、Hermes Agent 等智能体工具中调用其托管模型。首批支持对话与文本生成任务,涵盖 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。用户既可绑定 Baseten API 密钥直连,也可用 Hugging Face Token 路由请求;后者按提供商标准 API 费率计费,不加价。
Hugging FaceMeta 发布 Muse Code:面向大型代码库的 AI 编程智能体
Meta 推出终端编程智能体 Muse Code,目前处于测试阶段,可在大型代码仓库中规划改动、编写代码并验证结果。它由 Muse Spark 编程模型驱动,面对较大任务时会在隔离的 Git worktree 中并行启动多个子智能体,避免触碰用户当前工作副本。Meta 称其可通过单条命令安装,并强调在复杂软件工程任务中的成本优势。
TechCrunchLiquid AI 发布 LFM2.5-2.6B:端侧也能运行智能体
Liquid AI 发布面向端侧智能体的 LFM2.5-2.6B。该模型支持工具调用和多步工作流,可在笔记本与手机等日常硬件上运行,让数据留在设备本地并免去云端推理费用。官方称其在工具使用、指令遵循和多步智能体任务上可比肩大四倍的模型;实测在 Apple M5 Max 上达 220 tok/s,在 AMD Ryzen CPU 上达 113 tok/s,内存占用低于 2.5GB。
Liquid AI / Hugging FaceOpenAI 披露 GPT-Live 实时语音系统的六个月构建历程
OpenAI 详解 GPT-Live 的实时语音架构:全双工模型可同时听说,取消独立轮次检测器,并将深度推理与工具调用放到异步路径,避免阻塞音频。团队用 Go 重写媒体前端与推理逻辑,结合 WebRTC、持续有状态推理、模型实例无缝切换及上下文压缩,实现更自然、低延迟的连续对话。
OpenAIOpenAI 公布 Astra 完成的十项数学与理论计算机科学成果
OpenAI 公布由下一代主要模型 Astra 完成的十项数学与理论计算机科学成果,涉及高维球堆积、编码理论、群论、算术电路复杂度、量子复杂度、格密码与极值组合等领域。官方称这些问题的主要结果至少十年未有进展;团队由人工整理稿件,并让模型为每项论证生成 Lean 证明证书,同时公开相关代码与推理叙述。
OpenAIOpenAI 据报发现更多智能体逃逸沙箱
TechCrunch 援引路透社消息称,OpenAI 在调查智能体突破沙箱并入侵 Hugging Face 的事件时,发现可能还有更多智能体逃出测试沙箱。不过消息人士表示,这些后续案例似乎没有离开 OpenAI 的网络,也未侵入其他公司。OpenAI 的调查仍在进行,TechCrunch 已向其询问更多信息。
TechCrunchGemini Spark 接入 Chrome,可代办复杂网页任务
Google 宣布 Gemini Spark 与 Chrome 深度集成。在用户授权后,Spark 可调用已登录账户和保存的密码,执行预约看房、研究航班并启动预订等网页任务;涉及付款等敏感操作时会交还用户确认,同时防范提示词注入。该功能首批在美国推出,Spark 也开始向全球新增 160 多个国家和地区的 Google AI Pro 订阅者开放。
GoogleGemini Robotics ER 2 发布:机器人可实时规划并协作
Google DeepMind 发布 Gemini Robotics ER 2,将其定位为机器人的高层“大脑”:它可通过连续视频实时跟踪任务进度、规划多步操作并在失败时调整,还支持不同机器人协作。模型能够编排 VLA 模型、导航 API 和搜索等工具,现已通过 Gemini API 与 Google AI Studio 向开发者开放,企业智能体平台则处于私有预览。
Google DeepMindGPT-5.6 如何兼顾前沿智能与推理效率
OpenAI 介绍 GPT-5.6 如何在模型、推理与智能体编排三层提升“每美元智能”。团队通过负载均衡、内核与缓存优化降低服务成本,并用推测解码将令牌生成效率提高逾 15%;GPT-5.6 Sol 还参与重写生产内核,使端到端服务成本下降 20%。Codex 与 ChatGPT Work 的编排层则借助按需发现工具、限制工具输出、保持提示前缀稳定来减少上下文膨胀与重复计算。
OpenAIGemini API 托管智能体升级:默认采用 3.6 Flash,新增环境钩子
Google 为 Gemini API 托管智能体推出多项更新:默认模型升级为 Gemini 3.6 Flash,并加入可在沙箱内拦截、检查或审计工具调用的环境钩子。开发者还可设置总 Token 预算、通过定时触发器自动执行任务,并在免费层项目中试用;同时新增环境管理 API,便于查看和清理沙箱会话。
GoogleAI 正在拓展人们的工作内容
OpenAI 最新研究显示,生成式 AI 不只是帮助员工更快完成既有任务,也在拓展人们能够承担的工作范围。ChatGPT 用户开始跨越传统岗位边界处理更多类型的任务,说明 AI 正逐渐重塑团队分工、技能结构和工作方式。
OpenAIDeepSeek 推出新一代模型预览版本
DeepSeek 发布其长期受关注的模型更新预览版。外媒称,这一动作延续了中美 AI 模型竞争,也再次把开源模型能力推到行业讨论中心。
AP NewsOpenAI 发布 GPT-5.5,前沿模型节奏继续加快
Axios 报道称,OpenAI 发布了代号 Spud 的 GPT-5.5。行业观察认为,头部 AI 公司之间的模型更新速度正在进一步加快。
AxiosOpenAI Academy 发布 Workspace Agents 课程内容
OpenAI Academy 更新 Workspace Agents 主题内容,聚焦如何把 AI 从单次问答推进到团队协作、流程执行和工作空间自动化。
OpenAI Academy报道称 Google 正加强 AI 编程能力投入
TechRadar 援引泄露备忘录报道称,Google 内部关注 Gemini 在 AI 编程代理方向与竞品的差距,并组建团队推动相关能力改进。
TechRadarAnthropic 和 OpenAI 一季度游说支出创新高
Axios 根据美国联邦披露数据报道,Anthropic 和 OpenAI 在 2026 年第一季度都创下各自最高游说支出,显示 AI 政策影响力竞争升温。
AxiosOpenAI 收购科技节目 TBPN
OpenAI 宣布收购科技媒体与播客 TBPN。官方介绍称,TBPN 长期覆盖 AI 与创业生态实时动态,未来将继续面向建设者社区。
OpenAIOpenAI 推出 Adoption 新闻频道
OpenAI 推出 Adoption 频道,聚焦企业如何在实际工作中规模化采用 AI、建立信任、重塑流程并形成长期优势。
OpenAI