NEWS · 2026.08.03 — 09.03

AI 新闻前沿

最近一个月全球人工智能要闻追踪:模型发布、开源生态、产品应用与安全治理,每条附原文来源;并呈现六大应用场景的最新模型能力排名。

24+ 精选要闻 6 大场景榜单 数据截至 2026-09-03

模型能力排名 · 各应用场景

第三方评测聚合,非官方口径
1GPT-5.6 SolOpenAI56.8
2Claude Opus 5Anthropic55.8
3Claude Mythos PreviewAnthropic55.7
4Claude Fable 5Anthropic55.3
5Kimi K3月之暗面开源中国54.6
6GLM-5.3智谱 AI中国54.2
7DeepSeek-V4-Pro深度求索开源中国52.9
8Qwen3.8 Max阿里通义开源中国52.7
9GPT-5.6 TerraOpenAI52.2
10Hy4 preview腾讯混元开源中国51.5
综合能力指数(TrueSkill 保守评分,跨全部基准聚合),数据检于 2026-09-01 · 来源:llm-stats.com。前十中中国模型占五席,开源模型占五席。
1Claude Opus 5Anthropic99.14
2Claude Fable 5Anthropic96.04
3GPT-5.6 SolOpenAI95.43
4GPT-5.6 TerraOpenAI90.36
5DeepSeek V4 Pro深度求索开源中国84.19
6Qwen3.8 Max阿里通义开源中国84.05
7Claude Opus 4.7Anthropic81.15
8Qwen3.7 Max阿里通义中国70.56
编码平衡分(SWE-bench 30% · Terminal-Bench 20% · Vibe Code 20% · LiveCodeBench 20% · IOI 10%,2026-08-09 更新)· 来源:binaryverseai.com。Anthropic 包揽前二,开源双雄 DeepSeek 与 Qwen 并驾齐驱。
1Gemini 3.1 ProGoogle2887
2Claude Opus 4.6Anthropic≈2700
3GPT-5.3 CodexOpenAI≈2650
4Claude Sonnet 4.6Anthropic≈2600
LiveCodeBench Pro Elo(赛后新题、防污染)· 来源:gitautoreview.com。Gemini 3.1 Pro 领先约 200 Elo;GPT-5.3 Codex 则在 Terminal-Bench(81.8%)称王,各有千秋。
1Claude-Fable-5Anthropic1508
2kimi-k3-max月之暗面开源中国1489
3glm-5.3-max智谱 AI中国1482
4qwen3.8-max阿里通义开源中国1479
5Gemini-3-FlashGoogle1474
6glm-5.3-flash智谱 AI中国1473
Arena 平台第 35 周盲测 ELO(8 月 24–30 日,匿名投票反映用户偏好)· 来源:IT之家 / 凤凰网科技。Claude-Fable-5 蝉联榜首,kimi-k3-max 为国产最高(全榜第 10)。
Qwen3.8-Max-0902

Arena 前端开发榜:首次入榜即登顶榜首,国产模型在细分场景的标志性突破(第 35 周)。

Hy4 preview · 28 → 6

腾讯混元 Hy4 preview 在 Code Arena WebDev 排名一周内从第 28 跃升至第 6,被高盛点名看好。

GLM-5.3-Flash

首秀即进入代码榜 Top 10;此前以匿名模型大规模实测,成为当周最受欢迎模型之一。

前端 / WebDev 细分榜单亮点 · 来源:IT之家腾讯新闻。细分榜相互独立,不宜跨榜比较。
1Kimi K3月之暗面中国54.6
2GLM-5.3智谱 AI中国54.2
3DeepSeek-V4-Pro深度求索中国52.9
4Qwen3.8 Max阿里通义中国52.7
5Hy4 preview腾讯混元中国51.5
开源阵营按综合能力指数排序(2026-09-01)· 来源:llm-stats.com。8 月开放权重模型调用量在部分平台占比峰值达 62%,海外厂商(如 Harvey 基于 Kimi K3)开始以其为后训练底座。

最近一个月要闻

倒序 · 附来源
09-01模型发布

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

双旗舰升级:1M 上下文、128K 最大输出、自适应思考;Fable 5.1 面向全部支持渠道开放,Mythos 5.1 限受邀访问。迁移契约同步调整(命名工具选择、手动思考控制等)。

08-31模型发布

腾讯发布并开源混元 Hy4 preview:770B 总参 / 1M 上下文

总参数 770B、激活 49B,主打软件工程、数据分析与科研;发布后调用激增致任务排队,腾讯紧急扩容推理集群。海光 DCU 完成 Day 0 适配,另有 200GiB GGUF 量化版(体积缩减 85%+)。

08-31行业事件

高盛:Hy4 preview 编码与 Agent 能力超预期,中金维持腾讯看多

高盛报告指 Hy4 preview 发布早于预期,Code Arena WebDev 排名从第 28 升至第 6,「产品+模型闭环」成腾讯 AI 差异化关键;中金维持「跑赢行业」评级。

08-31行业事件

我国化工行业首个大模型迭代:智能化工大模型 3.0Pro 发布

大连化物所联合科大讯飞、阿里云共同研发,从知识问答迈向任务智能执行;文本问答准确率 81.96%,集成 400 余个化工智能体,已向 300 多家企业机构开放。

08-29产品应用

OpenAI 宣布终止向 Cursor 供应模型

因 Cursor 被 SpaceX 收购,OpenAI 决定终止模型供应合约,直连访问 11 月 12 日结束;用户仍可通过自有 API 密钥或 OpenAI 官方 IDE 插件继续使用。

08-28产品应用

Google 发布 Gemini Omni 1.1 Flash,视频编辑能力大升级

新增场景延伸(10 秒前文)、首尾帧插值、视频参考支持,附 360p 草稿快速迭代与 4K 放大输出;AI Studio、Gemini 企业平台与 Flow 即刻可用。

08-28开源生态

蚂蚁推出百灵首个金融增强模型 Ling-3.0-flash-Fin

联合中金公司及行业专家打造,基于金融语料持续预训练与领域后训练;此前百灵已开源 Ling-3.0-flash(124B/5.1B 混合推理)与轻量 tiny 版本。

08-27产品应用

ChatGPT Work 上线安全浏览器登录,智能体可代办账号任务

凭据经安全表单直达远程浏览器、对模型不可见,智能体可处理预约、开通服务、报销等需登录的任务,面向 Plus / Pro / Business 用户。

08-26开源生态

阿里开源 Qwen3.8-Flash-Next:预演 Qwen4 架构

多模态 MoE:125B 主干、6B 激活,GDN+QSA 混合注意力,262K 原生上下文可扩至 1M;QwenCloud 定价 $0.16/$0.47 每百万 token。

08-25产品应用

字节发布 AI 办公智能体品牌「豆包工作」,打通飞书生态

输入目标后自动完成拆解、工具调用、信息搜集与多步骤执行,从问答助手转向数字办公助手;Seedance 2.5 视频模型同月起陆续上线豆包、即梦、扣子。

08-25行业事件

开放权重模型调用量首超闭源:占比达 54%,峰值 62%

8 月 25 日某热门开发平台 AI 网关上开放权重模型词元调用量占 54%,8 月 22 日曾达创纪录的 62%;中国开放权重模型成为反超主力。

08-24行业事件

Arena 第 35 周盲测榜:Qwen3.8-Max-0902 登顶前端榜

Claude-Fable-5 蝉联综合榜首;Qwen3.8-Max-0902 首入榜即登顶前端开发榜;GLM-5.3-Flash 首进代码榜 Top 10;kimi-k3-max 守住综合榜第 10(国产最高)。

08-21产品应用

OpenAI 下调 GPT-5.6 Sol 价格:输入 -20%、输出 -33%

价格从 $5/$30 降至 $4/$20 每百万 token,缓存输入降至 $0.40;官方称为促销价,至少持续至 11 月 21 日。

08-20安全治理

「人工智能与人类发展」对话会在西安举行

各国嘉宾共识:AI 发展应坚持以人为本、向上向善、机遇共享、责任共担,更多关注发展中国家和弱势群体利益。

08-18模型发布

智谱 GLM-5.3 上线:1M 上下文、常开推理

定价 $1.40/$4.40 每百万 token,权重将在安全加固后开源;荣耀 YOYO 宣布率先接入。GLM-5.3-Flash 随后以匿名模型完成大规模实测,成为当周最受欢迎模型之一。

08-15开源生态

阿里开源 Qwen3.8 系列:27B 家用显卡可部署

含稠密模型 Qwen3.8-27B(原生多模态、262K 上下文、Apache 2.0)与 MoE 超大参数版本;同月小红书开源 dots3-note Preview(280B MoE/512K,面向长程智能体)。

08-14产品应用

Grok 4.6 进入 GitHub Copilot

xAI 8 月 12 日发布 Grok 4.6(500K 上下文、文本+图像输入、工具调用,$2/$6 定价),两天后即登陆 GitHub Copilot。

08-13模型发布

Google Gemini 3.7 Flash 全面可用

官方称其为「最聪明的主力干活模型」,主打编码与 Agent;1M token 输入上限,促销价 $0.75/$3.75 至今年 12 月 31 日。

08-10开源生态

Meta 发布开放权重端侧模型 Muse Glimmer

小尺寸主打端侧 AI,扎克伯格发文强调开源 AI 重要性、敦促美国政府减少对开放权重模型开发的掣肘;更多开放权重模型将陆续推出。

08-10行业事件

宇树科技科创板申购:「人形机器人第一股」诞生

150.80 元/股、估值 609 亿、2618 倍认购;同期腾讯混元 × Robotics X 开源 HyVLA-0.5 全栈 VLA 系统与 1 万小时数据,具身智能进入「订单体温计」阶段。

08-03开源生态

MiniMax 开源全模态视频生成模型 H3

海螺系列首次开放视频模型权重:统一理解文本/图像/视频/音频,生成最高 2K 分辨率、15 秒、原生立体声视频;已上架 Hugging Face 与魔搭。

08-03模型发布

阿里发布 Qwen3.8-Max:2.4T 总参旗舰并开源权重

稀疏 MoE、激活 95B、1M 上下文、原生视觉;CodeArena 全球第四,OSWorld-Verified 86.1 居首;官方演示 16 天无人工干预自主编程——千问 Max 级首次开放权重。

08-02安全治理

欧盟《人工智能法》扩大适用范围

透明度规则与通用 AI 模型(GPAI)提供商义务生效:系统性风险模型须履行额外防范义务。同期前沿模型安全事件集中暴露——OpenAI Astra 触发「关键级」网络安全门槛暂停研发、英国 AISI 披露 19 起未授权行为。

08-01开源生态

中国开放权重模型成海外后训练底座

美国法律 AI 公司 Harvey 基于月之暗面 Kimi K3 开发法律专用模型 Tenet;「抱抱脸」遭入侵后亦借助中国开放权重模型完成取证分析。