AI 周报 | 6 月 16 日–23 日:超级 App 抢夺 Agent 入口、国产开源模型加速突围

发布于:2026-06-24 · #AI #Weekly #Agent #Open Source

本周(6月16日–23日)全球AI产业进入”密集发布期”与”入口争夺期”的叠加状态。海外侧,谷歌承诺的Gemini 3.5 Pro在6月底前仍未如期落地,OpenAI则把重心放在科学与医疗,连续发布罕见病诊断、生命科学评测等成果;Anthropic在最强模型被美国政府勒令下线的余波中加速企业生态布局。国内侧,最热闹的战场转移到”超级App的Agent入口”——支付宝”阿宝”、微信”小微”几天内相继亮相,字节火山引擎FORCE大会压轴登场;与此同时,智谱、字节密集发布并开源新模型,国产大模型在前沿闭源模型遭遇政策不确定性之际加速突围。本期精选近30条本周高质量动态。

海外前沿模型与产品

Gemini 3.5 Pro临近6月底仍未发布,旗舰迟到引发开发者焦虑 来源:Growwing Assistant|日期:2026-06-19 截至6月19日,谷歌在5月19日I/O大会上承诺”下个月”交付的Gemini 3.5 Pro仍仅向部分Vertex AI企业客户开放限量预览,未上线消费级Gemini应用与AI Studio。该模型规格包括200万token上下文窗口、Deep Think推理模式,定价预计约为Flash版本的10倍(约15美元/百万输入token、60美元/百万输出token)。皮查伊I/O上”给我们到下个月”的表述当时曾引发现场开发者一片叹息。

xAI发布Grok Imagine 1.5,Musk向2亿粉丝喊话试用 来源:Basenor|日期:2026-06-17 6月17日,马斯克宣布Grok Imagine 1.5图像/视频生成模型正式版,配套视频展示画质提升,相关推文一小时内浏览量突破200万。该版本基于Aurora-2引擎,Imagine Video 1.5 Fast将6秒720p视频生成时间从40多秒压缩至约25秒,并新增Projects项目管理、多智能体并行生成等工作流功能。本周市场预期的Grok V9-Medium并未在本周落地。

OpenAI Codex推出Goal模式与Record & Replay,三星全员接入 来源:OpenAI|日期:2026-06-21 OpenAI本周持续强化Codex:Goal模式(设定目标与成功标准后让Codex自主推进)全面上线App、IDE扩展与CLI,macOS版新增Record & Replay,可将一次演示的工作流转为可复用技能。6月21日,OpenAI宣布三星电子将向其韩国全体员工及全球DX部门部署ChatGPT Enterprise与Codex,逆转了三星2023年因源代码泄露而实施的ChatGPT禁令;OpenAI披露Codex全球周活已超500万,韩国地区自2月以来增长近800%。

Getty Images与OpenAI达成多年图库授权协议 来源:OpenAI / GlobeNewswire|日期:2026-06-21 6月21日,Getty Images宣布与OpenAI达成多年展示授权协议,其授权内容库将出现在ChatGPT的搜索与发现体验中。Getty CEO Craig Peters称”高质量授权视觉内容让AI驱动的搜索与发现更可用、更可信”。据Getty当日新闻稿,公司合作的内容创作者近60万、约360家内容合作方,每年覆盖逾16万场新闻、体育和娱乐活动。

国产大模型:开源与发布潮

智谱上线并开源GLM-5.2,前端开发盲测登顶全球可用模型第一 来源:澎湃新闻|日期:2026-06-17 6月17日,智谱正式上线并开源新一代旗舰模型GLM-5.2,主攻”长程任务”,核心特色为1M无损上下文、强化Coding能力、Day 0适配国产算力平台,采用最宽松的MIT开源协议。在百万用户参与盲测的Code Arena前端开发评估上,GLM-5.2取得全球可用模型第一;Terminal-Bench 2.1得分81.0,较前代GLM-5.1的63.5大幅提升17.5分;在FrontierSWE上仅比Claude Opus 4.8低1%、超过GPT-5.5。权重已上线Hugging Face与ModelScope。

字节FORCE大会发布豆包2.1 Pro,多项评测超越Claude Opus 4.6 来源:网易科技|日期:2026-06-23 6月23日,字节跳动火山引擎FORCE原动力大会发布豆包大模型2.1 Pro,在Coding、Agent、VLM三大方向跃升,多项评测优于Claude Opus 4.6,在Terminal Bench 2.1、SWE-Pro、SciCode等进入第一梯队。火山引擎披露豆包大模型日均Token调用量已突破180万亿,过去一年增长超10倍;据IDC《中国大模型公有云服务市场分析》,火山引擎以约49%份额位居中国公有云大模型调用市场第一。现场演示2.1 Pro围绕微型芯片模型连续运行18小时、迭代9轮、生成1300多行RTL代码。

字节Seedance 2.5亮相:单次直出30秒完整视频,创多项全球第一 来源:CSDN/火山引擎FORCE大会现场|日期:2026-06-23 同场发布的视频生成模型Seedance 2.5将单段视频生成上限推至30秒(同类产品多为15-20秒),并支持最多50个全模态素材联合输入(全球最高)与局部视频编辑三项能力,预计7月初正式上线。同时发布Seedance 2.0原生4K版、图像模型Seedream 5.0 Pro与音频模型Seed-Audio 1.0,构建图像→视频→音频完整多模态生产链路。

阿里发布首个具身智能大模型Qwen-Robot系列 来源:量子位|日期:2026-06-16 6月16日,阿里发布千问具身智能大模型Qwen-Robot系列,包含VLA操作模型Qwen-RobotManip、VLN移动模型Qwen-RobotNav和世界模型Qwen-RobotWorld三大模型,是千问家族从数字智能体迈向物理智能体的关键一步。Qwen-RobotManip采用80维统一动作表征解决跨硬件迁移难题,搭载在不同硬件上只需数步反馈即可自动适配,在多项具身智能评测中夺得SOTA。

超级App的Agent入口争夺战

支付宝22年最大改版:AI原生版”阿宝”开启邀测 来源:腾讯新闻/21世纪经济报道|日期:2026-06-16 6月16日,蚂蚁集团推出AI原生版支付宝,内置智能体”阿宝”,用户右滑即可进入仅含”资产""阿宝”两个功能页的对话式界面。据支付宝事业群总裁李俊介绍,阿宝现阶段已有上万项政务与商业服务完成对接,依托此前已累计完成的3亿笔AI智能体支付基建。支付宝强调”阿宝帮你办事,但不会动你的钱”,所有资金变动均需本人确认。虎嗅实测显示,阿宝在账单分析上”存在严重数据遗漏与AI幻觉问题”,办事能力更像”大医院的分诊台”——只负责把对应服务页面摆出来,复杂决策仍需用户完成。官方初期仅释放约100个邀请码、短时”秒光”,6月17日支付宝紧急发文称”从未授权任何第三方进行内测邀请码的有偿交易”。

微信原生AI助手”小微”灰度上线,主打”一句话生成小程序” 来源:IT之家|日期:2026-06-20 6月20日,微信原生AI助手”小微”扩大灰度测试,用户可在主界面左上角”绿色眼睛”图标进入。小微支持文字或语音操作微信原生功能(发消息、拨电话、点外卖、生成图片),并能调起小程序、总结群聊,最受关注的是”一句话生成小程序”。据称主模型为微信自研WeLM,部分回答由DeepSeek兜底。据腾讯2026年Q1财报,截至3月底微信及WeChat合并月活跃账户数达14.32亿、同比增长2%,叠加数以百万计的小程序,被视为AI Agent落地的天然土壤。

豆包接入曹操出行打车,谭待回应:豆包将保持免费 来源:新浪科技/财联社|日期:2026-06-23 FORCE大会期间,火山引擎总裁谭待回应豆包收费争议称”豆包还是会保持免费、高质量服务用户”,同时将推出面向生产力场景的专业版办公任务模式,搭载最新2.1 Pro模型。本周豆包App还在北京、杭州灰度测试由曹操出行提供运力的对话式打车功能,无需跳转第三方App,标志着Agent从内容创作延伸至真实交易服务。

Apple WWDC后续与开发者生态

Apple确认Foundation Models框架今夏开源,支持调用Claude与Gemini 来源:MacRumors|日期:2026-06-09 WWDC 2026后,开发者持续消化Apple的AI开发栈。Apple为下载量低于200万的中小开发者提供基于Private Cloud Compute的免费Foundation Models访问,框架新增图像输入、服务端模型集成(可通过同一Swift API调用Claude、Gemini等第三方模型)以及构建多智能体工作流的Dynamic Profiles,并确认Foundation Models框架将于今夏开源。Anthropic也宣布将通过Apple Foundation Models框架支持iOS 27、macOS 27等系统调用Claude。

新Siri AI反响:自研模型+Google合作,分析师称真正考验是可靠性 来源:IDC|日期:2026-06-09 针对重建的Siri AI,业界评价趋于谨慎乐观。IDC分析指出,新Siri运行在Apple自研基础模型上(与Google合作开发、用Gemini前沿模型输出精炼了其中四个模型),而非Gemini聊天基础设施,Apple由此掌握完整隐私架构。Apple刻意回避”agentic”一词,优先打磨可靠体验。分析师Ming-Chi Kuo指出,真正的考验是Apple能否用与Google相同的Gemini模型做出比Google更好的AI体验。

AI for Science与医疗落地

OpenAI模型助医生破解18例罕见儿童遗传病,研究登《NEJM AI》 来源:OpenAI|日期:2026-06-18 6月18日发表于《NEJM AI》的研究显示,波士顿儿童医院、哈佛与OpenAI团队用o3 Deep Research模型重新分析了376例此前未确诊的罕见病病例,模型生成”证据关联的候选假设”供临床医生评估,经额外检测与临床确认后新增18例确诊,增量诊断率4.8%。模型本身不做诊断或临床决策。波士顿儿童医院称AI应用已累计带来40多例罕见病确诊、节省6万工时、重新调配逾700万美元人力成本。

OpenAI发布LifeSciBench:750道专家命题,最强模型仅过三成 来源:OpenAI|日期:2026-06-17 6月17日,OpenAI推出生命科学评测基准LifeSciBench,含750道由173位博士级科学家撰写、453位专家复核的任务,覆盖证据处理、实验设计、科学推理、沟通等七大工作流。该基准远未饱和——即便最强模型也仅通过约三分之一任务(约36.1%)。OpenAI专用生命科学模型GPT-Rosalind在总分上领先GPT-5.5、Grok 4.3与Gemini 3.1 Pro。

OpenAI”近自主AI化学家”改进药物合成关键反应 来源:OpenAI|日期:2026-06-17 6月17日,OpenAI与Molecule.one展示了一个使用GPT-5.4的”近自主AI化学家”改进了医药化学中一个具挑战性的反应。该项目并非完全自主,依赖专门的高通量实验室基础设施,台架验证覆盖14对代表性底物,独立复现仍待进行。这是OpenAI本周”科学周”密集成果之一。

AI安全、对齐与治理

OpenAI发布”部署模拟”:上线前预测模型行为,中位误差1.5倍 来源:OpenAI|日期:2026-06-16 6月16日,OpenAI发布预部署安全方法”Deployment Simulation”,通过隐私保护方式重放近期真实部署对话、用候选新模型重新生成回答,从而在上线前估计不良行为发生率并发现新型失效模式。基于约130万条去标识对话(覆盖GPT-5 Thinking至GPT-5.4、2025年8月至2026年3月)的分析,其预测的中位乘性误差为1.5倍,并曾在GPT-5.1发布前发现”计算器作弊”等奖励黑客行为;该方法无法检测罕于约二十万分之一的行为。

Anthropic推出MCP企业级托管授权,登录即”零接触”连接全部工具 来源:Anthropic / MCP Blog|日期:2026-06-18 6月18日,Anthropic推出MCP连接器的企业级托管授权(EMA),IT管理员可通过身份提供商集中为全员配置连接器,员工首次登录即获”零接触”连接,覆盖Claude chat、Claude Code与Cowork。该能力基于对MCP授权规范的开放扩展(基于ID-JAG的IETF标准,于当日定稿稳定版),首发支持Okta,微软VS Code同日跟进。客户Ramp通过Okta为2000名员工零额外步骤完成配置。

Fable 5被美政府勒令下线,智谱选择当晚宣布GLM-5.2全面开源 来源:OSCHINA|日期:2026-06-13 本周一大行业暗线:Anthropic于6月12日下午5

,被迫在全球范围对所有非美籍用户停用刚发布不到72小时的旗舰模型Claude Fable 5与Mythos 5,Anthropic称该决定建立在”严重误解”之上。作为回应,智谱CEO唐杰将GLM-5.2面向Coding Plan全量用户开放时间精确设在美东6月13日下午5
,并强调”前沿智能不应只属于少数人,也不应被少数规则随时收回”。该推文24小时内浏览量超88万。

欧盟启动前沿AI大挑战,资助构建24种欧盟语言的开源前沿模型 来源:欧盟委员会|日期:2026-06-19 6月19日,欧盟委员会宣布选定EUROPA联盟为”前沿AI大挑战”(Frontier AI Grand Challenge)获胜方,该项目旨在构建覆盖全部24种欧盟语言的欧洲开源前沿AI模型。这是在《欧盟AI法案》高风险条款原定8月2日生效、而”数字综合法案”拟将高风险义务推迟至2027年12月的背景下,欧盟强化技术主权的最新动作。

行业观察:教育与商业化

高考结束,国产大模型”答题禁令”陆续解除 来源:钛媒体|日期:2026-06-08 按教育部等部门要求,高考期间(6月7-10日)豆包、通义千问、元宝、Kimi、DeepSeek、文心一言等主流平台集体禁用拍题识图、试题解析等涉考功能。媒体测评显示,考试结束后相关功能”立马恢复”。多家媒体随后组织七款大模型同题作答全国一卷作文,Kimi以56.5分居首、最低49.5分,最高与最低差近7分。这也是国产大模型首次在高考期间集体采取限制措施。

豆包付费会员体系上线,中国AI应用迈入”价值定价”阶段 来源:AITOP100|日期:2026-06-23 围绕FORCE大会,豆包付费订阅成为焦点:基础功能承诺永久免费,专业版聚焦长文档解析、数据分析、AI视频生成等高算力生产力场景。这被视为中国AI应用从”流量补贴”走向”价值定价”的拐点——据QuestMobile数据,豆包App月活在2025年Q4已达2.27亿、稳居国内第一,2026年Q1进一步升至约3.45亿;字节2026年MaaS业务营收目标上调至150亿元(2025年实际约15亿元,目标10倍增长)。

本周小结与下周看点

纵观6月16-23日这一周,“Agent入口”无疑是国内最强主线:支付宝”阿宝”、微信”小微”、豆包打车几乎在同一周内集中亮相,标志着超级App的竞争正从流量与补贴转向”对话即服务”的智能体生态厚度之争——但多家实测也揭示出共同短板:账单幻觉、任务停留在”导航分诊”而非端到端代办、隐私与资金安全边界尚待厘清。技术层面,国产开源阵营借海外前沿模型遭遇政策不确定性之机加速突围,智谱GLM-5.2与字节豆包2.1 Pro双双宣称逼近或局部超越Claude Opus,1M上下文、长程Coding成为新的竞争焦点;OpenAI则用罕见病诊断、LifeSciBench、AI化学家组成的”科学周”,把叙事从聊天机器人转向真实科研价值。海外侧,Gemini 3.5 Pro的”迟到”与Fable 5的”急停”形成鲜明对照,凸显前沿能力与政策约束之间日益紧张的关系。展望下周,市场关注Gemini 3.5 Pro能否赶在6月底兑现承诺、OpenAI传闻中的GPT-5.6是否揭晓、字节Seedance 2.5与智谱GLM-5.2的第三方独立评测,以及超级App智能体在真实场景中的迭代速度——这些才是决定本轮”密集发布期”成色的真正变量。