NEWS / 01

资讯

按发布时间追踪 AI 模型、工具与公司的最新记录。

最新发布

阿里巴巴Qwen3.8-27B

阿里云开源 Qwen3.8-27B:混合注意力架构与消费级单卡长程 Agent

阿里云通义千问团队正式开源 27B 参数量稠密多模态模型 Qwen3.8-27B。新模型采用 48 层线性注意力与 16 层门控注意力的混合架构,内置 MTP 草稿头与可控思考模式,原生支持 262K 超长上下文并兼容消费级单卡本地部署,在 SWE-bench Pro 与 LiveCodeBench 等基准测试中大幅超越前代。

内容优先级97

Timeline

按发布时间继续阅读

  1. 02
    GLM-5.3

    智谱发布 GLM-5.3:强化后训练强化学习与网络安全能力,两周内开源权重

    智谱 AI 正式发布基于 743B 基础模型深度后训练的新一代旗舰模型 GLM-5.3。借助 IndexShare、SAO 强化学习算法与 Slime 异步训练框架,该模型在 CyberGym 漏洞挖掘(84.5%)、AutomationBench(48.2%)与 GDPval-AA v2(1769)多项榜单取得第一,并在 Terminal Bench 3.0 达到 28.3 分,官方计划于两周内开源模型权重。

  2. 03
    DeepSeek Harness深度求索

    DeepSeek 开源模块化 Agent 框架 DeepSeek Harness

    DeepSeek 正式开源模块化智能体框架 DeepSeek Harness(dsh)。该项目基于 Cordis 元框架构建,采用全插件化架构解耦模型接入、执行循环与工具系统,并提供终端与本地 Web 界面,旨在为开发者提供高可扩展且支持全量审计的开源 Agent 开发与装配环境。

  3. 04
    Gemini 3.7 Flash

    谷歌发布 Gemini 3.7 Flash:主打长程编程与 Agent 工作流,首发 API 降价 50%

    谷歌正式发布 Gemini 3.7 Flash,主打长程代码编写与 Agent 工作流执行。模型具备 100 万 Token 上下文窗口与分级思考能力,在 DeepSWE 与 FrontierCode 等工程基准测试中较 3.6 Flash 明显提升,并在 2026 年底前提供 50% 的 API 调用折扣。

  4. 05
    深度求索

    DeepSeek V4-Pro 正式版上线:全面超过 Preview,API 调用方式不变

    DeepSeek V4-Pro 正式版已经上线,版本号为 DeepSeek-V4-Pro-0813,现有 API 模型名和调用方式保持不变。DeepSeek 公布的评测显示,正式版在十项 Agent 相关评测上全部超过 Preview,并在 Cybergym、AutomationBench 等项目进入当前前沿模型的第一梯队;生产环境仍需结合内部任务复测。

  5. 06
    Qwen3.8-Max阿里巴巴

    阿里巴巴发布 Qwen3.8-Max 旗舰大模型

    阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max。新模型采用 2.4 万亿参数的稀疏混合专家(MoE)架构,单次激活 950 亿参数,原生支持 100 万 Token 上下文与多模态输入。新模型重点强化了长程自主编程与复杂智能体任务执行能力,并在 Arena 综合评测与视觉榜单中位居前列。官方同时宣布将在次周正式开源模型权重。

  6. 07
    字节跳动Seedance 2.5

    字节跳动发布 Seedance 2.5 视频生成模型

    字节跳动正式发布新一代视频生成模型 Seedance 2.5。新模型在统一的多模态音视频联合生成架构基础上,将单次生成时长翻倍至 30 秒,支持最多 50 个多模态素材参考输入,并引入了基于时间戳的局部精准编辑与原生 4K 输出能力,推动 AI 视频生成从短片段生成走向可工业化交付的完整创作。

  7. 08
    DeepSeek-V4-Flash深度求索

    DeepSeek-V4-Flash 官方正式版 API 开启公测

    DeepSeek 宣布 DeepSeek-V4-Flash 官方正式版 API 开启公测,版本标识符为 DeepSeek-V4-Flash-0731。在保持 284B 总参数与 13B 激活参数的轻量 MoE 架构下,新版模型经过重新后训练,其 Agent 核心能力大幅提升,在 Terminal Bench 2.1 和 Toolathlon 等多项基准测试上已接近甚至超越早期 V4-Pro 预览版。

  8. 09

    camelAI 架构重构:剥离虚拟机与 Bash 终端,全量迁入 Cloudflare Durable Object

    camelAI CTO 详细拆解了将其 Coding Agent 彻底拔除 VM 架构的演进过程。通过将 Agent 搬入 Cloudflare Durable Object,利用 SQLite 与 R2 持久化文件系统,并改用 Code Mode + Dynamic Workers 在 JS 沙箱中通过显式 API 执行代码,实现了架构简化、延迟降低与运行成本的量级暴跌。

  9. 10
    OpenAI

    OpenAI 分析 80 万条工作提示词:43.5% 专业任务出现跨职能渗透

    OpenAI 发布最新职场研究报告,基于美国超过 80 万条 ChatGPT 商业账号工作消息分析发现,剔除通用办公需求后,43.5% 的具体岗位消息涉及跨职能任务。客服、设计和 HR 岗位跨界频次最高,财务计算与代码排障成为渗透率最广的跨界技能。

  10. 11
    模型上下文协议

    Anthropic 联合 AAIF 正式发布 MCP 2026-07-28 规范,协议全面转向无状态架构

    2026年7月28日,Anthropic 联合 Agentic AI Foundation 正式发布 MCP 2026-07-28 规范。作为 MCP 开源发布以来最大规模的架构升级,新规范彻底废除有状态会话与初始化握手,转向完全自描述的无状态请求模式,同时推出标头路由与官方扩展框架。

  11. 12
    Codex SecurityOpenAI

    OpenAI 开源 Codex Security CLI 与 SDK,支持代码漏洞自动验证与 Patch 修补

    2026年7月28日,OpenAI 正式在 GitHub 上以 Apache-2.0 许可证开源了 Codex Security 的 CLI 工具与 TypeScript SDK。作为一款 AI 驱动的应用安全 Agent(内部代号 Aardvark),Codex Security 突破了传统 SAST 工具依赖静态规则的局限,能够结合仓库上下文构建威胁模型,在隔离沙箱中自动验证漏洞并生成修复 Patch,大幅提升 DevSecOps 效率。

  12. 13
    Kimi K3月之暗面

    月之暗面开源 2.8 万亿参数大模型 Kimi K3,同步开放训练与算子基础设施

    月之暗面于 2026 年 7 月 27 日宣布向全球社区完整开源旗舰模型 Kimi K3 的模型权重。该模型拥有 2.8 万亿参数,采用混合线性注意力机制 KDA 与注意力残差架构,原生支持多模态及 100 万 token 上下文。团队同步开源了包含 MoonEP 分布式并行库与 FlashKDA 算子在内的全套基础设施。

  13. 14
    谷歌

    Google 发布 ATLAS 首期 AI 经济学报告:分析 1465 万条真实对话,评估 AI 职场替代效应

    Google DeepMind 联合首席经济学家办公室发布 ATLAS v1.0 报告,基于 1465 万条去标识化对话分析全球 AI 采纳特征。研究显示 AI 延伸覆盖 68% 职业但具体任务渗透率仅 21%,完全自动化不足 10%,86% 交互发生在非工作场景,非英语交互占比高达 66.7%。

  14. 15

    英伟达CEO黄仁勋专访驳斥“AI末日论”:称失业恐慌纯属一派胡言,公开力挺中国开源模型与基建扩容

    英伟达首席执行官黄仁勋在 Axios 独家专访中猛烈抨击针对 AI 的末日论调与科幻式监管政策,指出将 AI 视为人类末日或造成普遍失业完全是一派胡言。他同时高度评价中国开源 AI 模型的质量,破除开源“后门迷思”,呼吁决策者切勿只听信一两位科技巨头 CEO 的言论,并预测全球 AI 计算与能源基建在未来数年仍需扩展 5 至 10 倍。

  15. 16
    AnthropicClaude Opus 5

    Claude Opus 5 基准测试结果公布:前沿对比登顶,定义 AI 推理新标杆

    Anthropic 最新发布的 Claude Opus 5 在各项基准测试中表现亮眼。在 Humanity's Last Exam (HLE) 获得 64.7% 登顶榜首,MMLU-Pro 达到 91.59%,SWE-bench Verified 达到 97.00%,在与 GPT-5.6 Sol、Claude Fable 5、Kimi K3、Opus 4.8 等模型的横向对比中全面超越。

  16. 17
    AnthropicClaude Opus 5

    Anthropic 正式发布 Claude Opus 5

    Anthropic 于 2026 年 7 月 24 日正式发布 Claude Opus 5。该模型智力接近旗舰 Claude Fable 5,维持每百万 Token $5/$25 的价格,引入默认思考机制与 Effort 深度调节,并在安全对齐性上取得显著突破。

  17. 18
    深度求索

    网传梁文锋投资者交流转写稿:DeepSeek谈开源、算力与Agent路线

    7月23日,一份42页的《梁文锋投资者交流会·录音文字稿》在公开渠道流传。文件自称整理自5月20日约3小时44分钟的录音,并注明由语音识别自动转写、经AI整理,未区分说话人。材料围绕开源与API定价、融资与算力、持续学习和Coding Agent展开;由于原始音频及DeepSeek官方确认尚未公开,芯片数量、财务预测和模型路线图等内容仍需按未独立核验的会议材料处理。

  18. 19
    Gemini 3.5 Flash CyberGemini 3.6 FlashGemini 3.5 Flash-Lite

    Google 集中发布 Gemini 3.6 Flash、3.5 Flash-Lite 及安全专用模型 3.5 Flash Cyber:聚焦 Agent 吞吐与领域精调

    Google 于 2026 年 7 月 21 日发布三款 Flash 阵营模型:主力模型 Gemini 3.6 Flash 输出 Token 消耗减少 17% 且编程性能提升 65%;极速版 3.5 Flash-Lite 生成速度达 350 token/s 并支持 Computer Use 与思考层级调节;安全特化版 3.5 Flash Cyber 结合 CodeMender 用于自动化漏洞挖掘。此外,AI 编码工具 Antigravity 现已全面接入并支持 Gemini 3.6 Flash 模型。

  19. 20
    阿里云Qwen-Image-3.0

    阿里通义实验室发布第三代图像生成基础模型 Qwen-Image-3.0:主打“实”字,加速向生产力场景渗透

    阿里巴巴通义实验室发布第三代图像生成基础模型 Qwen-Image-3.0。该模型聚焦生产力实用场景,支持 4.5k token 长指令输入,具备 10px 微细文字渲染与多层级 UI 逻辑嵌套能力,并支持 12 国语言和联网实时知识获取。