数据来自 AI HOT 过去 24 小时精选动态,本文在原始资讯基础上补充趋势点评、落地建议,并同步更新到本站「AI 资讯播客」。

今日总览

本期基于 AI HOT 过去 24 小时精选动态,重点关注 模型发布/更新、技巧与观点、产品发布/更新。核心信号是:DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强;GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能;小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座。

我把 12 条重点动态压缩成以下核心信号:

  1. DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强DeepSeek:API 更新日志。DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力…
  2. GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能OpenAI:官网动态(RSS · 排除企业/客户案例)。GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启…
  3. 小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座公众号:小红书技术(dots.llm)。小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度…
  4. GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力公众号:智谱(GLM)。智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Benc…
  5. Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型Google DeepMind:Blog(RSS)。Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 …

一、模型发布/更新

1. DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强

摘要: DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。

我的点评: Agent 正在从单次对话走向可审计的任务执行系统,真正的门槛会落在权限、上下文、评测和回滚。

建议: 不要只做问答 Demo,优先用真实长文档、代码仓库、多轮工具调用和成本曲线来评测。

2. 小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

摘要: 小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。

我的点评: 模型竞争已经进入能力、速度、成本和可部署性的复合阶段,单看榜单分数会低估工程效率的重要性。

建议: 不要只做问答 Demo,优先用真实长文档、代码仓库、多轮工具调用和成本曲线来评测。

3. GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力

摘要: 智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGy…

我的点评: Claude Fable 强调的不是更会执行命令,而是帮助用户发现盲点。高质量人机协作正在从“下指令”转向“共同暴露假设、未知和验证路径”。

建议: 每次交给模型实现前,先让它列出假设、未知、风险、反例和验证计划;完成后再让它对照这些清单做一次盲点复盘。

4. Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型

摘要: Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

我的点评: Agent 正在从单次对话走向可审计的任务执行系统,真正的门槛会落在权限、上下文、评测和回滚。

建议: 不要只做问答 Demo,优先用真实长文档、代码仓库、多轮工具调用和成本曲线来评测。

5. DeepSeek V4 Pro 登陆硅基流动,1M 上下文

摘要: DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同…

我的点评: Agent 正在从单次对话走向可审计的任务执行系统,真正的门槛会落在权限、上下文、评测和回滚。

建议: 不要只做问答 Demo,优先用真实长文档、代码仓库、多轮工具调用和成本曲线来评测。

6. MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型

摘要: MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。

我的点评: 模型竞争已经进入能力、速度、成本和可部署性的复合阶段,单看榜单分数会低估工程效率的重要性。

建议: 不要只做问答 Demo,优先用真实长文档、代码仓库、多轮工具调用和成本曲线来评测。

二、产品发布/更新

1. Qwen3.8-2.4T-A95B 开源,硅基流动即日上线

摘要: 阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。

我的点评: Qwen3.8 把国产开源模型继续推向超大参数与前沿对标区间。对企业来说,关注点应从“参数有多大”转向中文长上下文、代码、工具调用、部署成本和许可证能否支撑真实业务。

建议: 把 Qwen3.8 放进真实中文任务集评测:长文档问答、代码修改、函数调用、多轮 Agent、成本和延迟;如果考虑私有化,还要提前核查权重、许可证、推理栈和芯片适配。

2. DeepSeek Harness v0.1 开发者预览版发布

摘要: DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为”一切皆插件”,模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。

我的点评: Agent 正在从单次对话走向可审计的任务执行系统,真正的门槛会落在权限、上下文、评测和回滚。

建议: 产品团队应明确它解决的高频任务、接入的数据源、人工接管点和可量化指标。

3. Cursor 推出 builds:云智能体启动速度提升至 3 倍

  • 来源: Cursor Blog
  • 时间: 8/13 20:00(约 18 小时前)
  • AI HOT 热度: 65

摘要: Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环…

我的点评: Agent 正在从单次对话走向可审计的任务执行系统,真正的门槛会落在权限、上下文、评测和回滚。

建议: 产品团队应明确它解决的高频任务、接入的数据源、人工接管点和可量化指标。

三、技巧与观点

1. GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

摘要: GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以…

我的点评: Agent 正在从单次对话走向可审计的任务执行系统,真正的门槛会落在权限、上下文、评测和回滚。

建议: 把观点转成可执行清单,例如评测脚本、流程模板、成本看板或团队使用规范。

2. 从0到1带你速通DeepSeek Harness。

摘要: 从0到1带你速通DeepSeek Harness。

我的点评: 这条动态值得从方法论、最佳实践和落地风险三个维度继续跟踪,短期看产品信号,长期看能否沉淀为稳定能力。

建议: 把观点转成可执行清单,例如评测脚本、流程模板、成本看板或团队使用规范。

3. Claude 接管应用日常维护:388 个 PR 的实践

摘要: Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通…

我的点评: Agent 正在从单次对话走向可审计的任务执行系统,真正的门槛会落在权限、上下文、评测和回滚。

建议: 把观点转成可执行清单,例如评测脚本、流程模板、成本看板或团队使用规范。

今日行动建议

给开发者

  • 把热点模型和工具放到真实仓库、真实数据、真实测试链路中评估。
  • 建立质量、延迟、吞吐、成本、失败回滚五个指标,不只看榜单或演示。
  • 对 Agent 工作流保留日志、分支隔离、权限规则和人工接管点。

给产品经理 / 创业者

  • 先定义高频任务和闭环结果,再选择模型、工具和入口。
  • 把独有数据、行业流程和评测集沉淀为护城河。
  • 对高速模型、免费额度和平台补贴保持成本敏感。

给企业管理者

  • AI 转型要同步设计培训、岗位协作和绩效指标,避免只变成降本口号。
  • 采购 AI 工具时,把权限、审计、数据合规、供应商持续性写进标准。
  • 每周复盘 AI 项目的实际节省时间、错误率和员工接受度。

结语

今天的 AI 竞争继续从单点模型能力转向系统效率、产品闭环、治理边界和组织执行力。建议团队把新闻转成可验证的评测、预算、权限和复盘机制,而不是只停留在热点追踪。

播客入口:AI 资讯播客;本期文字稿链接:/posts/81414/