最新发布
阿里云开源 Qwen3.8-27B:混合注意力架构与消费级单卡长程 Agent
阿里云通义千问团队正式开源 27B 参数量稠密多模态模型 Qwen3.8-27B。新模型采用 48 层线性注意力与 16 层门控注意力的混合架构,内置 MTP 草稿头与可控思考模式,原生支持 262K 超长上下文并兼容消费级单卡本地部署,在 SWE-bench Pro 与 LiveCodeBench 等基准测试中大幅超越前代。
NEWS / 01
按发布时间追踪 AI 模型、工具与公司的最新记录。
最新发布
阿里云通义千问团队正式开源 27B 参数量稠密多模态模型 Qwen3.8-27B。新模型采用 48 层线性注意力与 16 层门控注意力的混合架构,内置 MTP 草稿头与可控思考模式,原生支持 262K 超长上下文并兼容消费级单卡本地部署,在 SWE-bench Pro 与 LiveCodeBench 等基准测试中大幅超越前代。
Timeline
智谱 AI 正式发布基于 743B 基础模型深度后训练的新一代旗舰模型 GLM-5.3。借助 IndexShare、SAO 强化学习算法与 Slime 异步训练框架,该模型在 CyberGym 漏洞挖掘(84.5%)、AutomationBench(48.2%)与 GDPval-AA v2(1769)多项榜单取得第一,并在 Terminal Bench 3.0 达到 28.3 分,官方计划于两周内开源模型权重。
DeepSeek 正式开源模块化智能体框架 DeepSeek Harness(dsh)。该项目基于 Cordis 元框架构建,采用全插件化架构解耦模型接入、执行循环与工具系统,并提供终端与本地 Web 界面,旨在为开发者提供高可扩展且支持全量审计的开源 Agent 开发与装配环境。
谷歌正式发布 Gemini 3.7 Flash,主打长程代码编写与 Agent 工作流执行。模型具备 100 万 Token 上下文窗口与分级思考能力,在 DeepSWE 与 FrontierCode 等工程基准测试中较 3.6 Flash 明显提升,并在 2026 年底前提供 50% 的 API 调用折扣。
DeepSeek V4-Pro 正式版已经上线,版本号为 DeepSeek-V4-Pro-0813,现有 API 模型名和调用方式保持不变。DeepSeek 公布的评测显示,正式版在十项 Agent 相关评测上全部超过 Preview,并在 Cybergym、AutomationBench 等项目进入当前前沿模型的第一梯队;生产环境仍需结合内部任务复测。
阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max。新模型采用 2.4 万亿参数的稀疏混合专家(MoE)架构,单次激活 950 亿参数,原生支持 100 万 Token 上下文与多模态输入。新模型重点强化了长程自主编程与复杂智能体任务执行能力,并在 Arena 综合评测与视觉榜单中位居前列。官方同时宣布将在次周正式开源模型权重。
字节跳动正式发布新一代视频生成模型 Seedance 2.5。新模型在统一的多模态音视频联合生成架构基础上,将单次生成时长翻倍至 30 秒,支持最多 50 个多模态素材参考输入,并引入了基于时间戳的局部精准编辑与原生 4K 输出能力,推动 AI 视频生成从短片段生成走向可工业化交付的完整创作。
DeepSeek 宣布 DeepSeek-V4-Flash 官方正式版 API 开启公测,版本标识符为 DeepSeek-V4-Flash-0731。在保持 284B 总参数与 13B 激活参数的轻量 MoE 架构下,新版模型经过重新后训练,其 Agent 核心能力大幅提升,在 Terminal Bench 2.1 和 Toolathlon 等多项基准测试上已接近甚至超越早期 V4-Pro 预览版。
camelAI CTO 详细拆解了将其 Coding Agent 彻底拔除 VM 架构的演进过程。通过将 Agent 搬入 Cloudflare Durable Object,利用 SQLite 与 R2 持久化文件系统,并改用 Code Mode + Dynamic Workers 在 JS 沙箱中通过显式 API 执行代码,实现了架构简化、延迟降低与运行成本的量级暴跌。
OpenAI 发布最新职场研究报告,基于美国超过 80 万条 ChatGPT 商业账号工作消息分析发现,剔除通用办公需求后,43.5% 的具体岗位消息涉及跨职能任务。客服、设计和 HR 岗位跨界频次最高,财务计算与代码排障成为渗透率最广的跨界技能。
2026年7月28日,Anthropic 联合 Agentic AI Foundation 正式发布 MCP 2026-07-28 规范。作为 MCP 开源发布以来最大规模的架构升级,新规范彻底废除有状态会话与初始化握手,转向完全自描述的无状态请求模式,同时推出标头路由与官方扩展框架。
2026年7月28日,OpenAI 正式在 GitHub 上以 Apache-2.0 许可证开源了 Codex Security 的 CLI 工具与 TypeScript SDK。作为一款 AI 驱动的应用安全 Agent(内部代号 Aardvark),Codex Security 突破了传统 SAST 工具依赖静态规则的局限,能够结合仓库上下文构建威胁模型,在隔离沙箱中自动验证漏洞并生成修复 Patch,大幅提升 DevSecOps 效率。
月之暗面于 2026 年 7 月 27 日宣布向全球社区完整开源旗舰模型 Kimi K3 的模型权重。该模型拥有 2.8 万亿参数,采用混合线性注意力机制 KDA 与注意力残差架构,原生支持多模态及 100 万 token 上下文。团队同步开源了包含 MoonEP 分布式并行库与 FlashKDA 算子在内的全套基础设施。
Google DeepMind 联合首席经济学家办公室发布 ATLAS v1.0 报告,基于 1465 万条去标识化对话分析全球 AI 采纳特征。研究显示 AI 延伸覆盖 68% 职业但具体任务渗透率仅 21%,完全自动化不足 10%,86% 交互发生在非工作场景,非英语交互占比高达 66.7%。
英伟达首席执行官黄仁勋在 Axios 独家专访中猛烈抨击针对 AI 的末日论调与科幻式监管政策,指出将 AI 视为人类末日或造成普遍失业完全是一派胡言。他同时高度评价中国开源 AI 模型的质量,破除开源“后门迷思”,呼吁决策者切勿只听信一两位科技巨头 CEO 的言论,并预测全球 AI 计算与能源基建在未来数年仍需扩展 5 至 10 倍。
Anthropic 最新发布的 Claude Opus 5 在各项基准测试中表现亮眼。在 Humanity's Last Exam (HLE) 获得 64.7% 登顶榜首,MMLU-Pro 达到 91.59%,SWE-bench Verified 达到 97.00%,在与 GPT-5.6 Sol、Claude Fable 5、Kimi K3、Opus 4.8 等模型的横向对比中全面超越。
Anthropic 于 2026 年 7 月 24 日正式发布 Claude Opus 5。该模型智力接近旗舰 Claude Fable 5,维持每百万 Token $5/$25 的价格,引入默认思考机制与 Effort 深度调节,并在安全对齐性上取得显著突破。
7月23日,一份42页的《梁文锋投资者交流会·录音文字稿》在公开渠道流传。文件自称整理自5月20日约3小时44分钟的录音,并注明由语音识别自动转写、经AI整理,未区分说话人。材料围绕开源与API定价、融资与算力、持续学习和Coding Agent展开;由于原始音频及DeepSeek官方确认尚未公开,芯片数量、财务预测和模型路线图等内容仍需按未独立核验的会议材料处理。
Google 于 2026 年 7 月 21 日发布三款 Flash 阵营模型:主力模型 Gemini 3.6 Flash 输出 Token 消耗减少 17% 且编程性能提升 65%;极速版 3.5 Flash-Lite 生成速度达 350 token/s 并支持 Computer Use 与思考层级调节;安全特化版 3.5 Flash Cyber 结合 CodeMender 用于自动化漏洞挖掘。此外,AI 编码工具 Antigravity 现已全面接入并支持 Gemini 3.6 Flash 模型。
阿里巴巴通义实验室发布第三代图像生成基础模型 Qwen-Image-3.0。该模型聚焦生产力实用场景,支持 4.5k token 长指令输入,具备 10px 微细文字渲染与多层级 UI 逻辑嵌套能力,并支持 12 国语言和联网实时知识获取。