08.23
2026-08-23 · 星期日 · 06:19 截稿 · 覆盖近 1-3 天动态
模型在打价格和入口。OpenAI 下调 GPT-5.6 Sol 的 API 与积分价格逾 20%,促销至少持续到 11 月 21 日;DeepSeek 把 V4-Flash 视觉实验模型接到 API,图文可混输,图片按 Flash 计价,Files 暂免费。公开分数和仓库任务仍对不上:NVIDIA 称编程智能体 AVO 在 ARC-AGI-3 公开集 183 关全过,讨论很快转到测的是模型还是脚手架;SWE-bench Science 覆盖 20 个科学领域、119 个仓库级修复,Claude Code 加 Opus-5 的 pass@1 仍低于 50%,另一项评测里带记忆策略还全面弱于关掉记忆。赚钱路径更土一些:有人在欧洲远程给两家美国客户做 AI 集成和数据流水线,月入接近 1 万美元,自有 SaaS 还在后面养;Capka、OpenCode 和 MiniMax Design 则在把 Agent 从聊天窗口挪到沙箱任务、本地编程和广告成片调度。
商业变现
1 条
产品发布
4 条
DeepSeek上线V4-Flash-Vision-Exp多模态API并开放免费Files接口
DeepSeek实验模型deepseek-v4-flash-vision-exp已上线,文本与Agent能力对齐V4-Flash,并支持图文混合输入。图片按Flash价格计费、单张最多384 tokens,可通过base64、URL或免费Files API的file_id调用。
OpenAI下调GPT-5.6 Sol API与积分价格,促销至少持续三个月
OpenAI宣布将GPT-5.6 Sol的API及ChatGPT Work、Codex积分价格下调逾20%,标准短上下文现为每百万token输入4美元、输出20美元。促销至少持续至2026年11月21日,Pro/Plus/Business订阅价不变。
MiniMax Design上线:用Agent串联H3完成多模态成片
MiniMax推出创作工作台MiniMax Design,由主Agent拆解任务并并行调度文案、图像、视频、音频子智能体。产品面向广告与电商成片,支持本地素材接入、私有化部署与API扩展。
科大讯飞预告全国产算力主力通用大模型,8月底先出阶段性版本
科大讯飞总裁吴晓如在半年报说明会上表示,公司将在2026年1024开发者节发布基于全国产算力的新主力通用大模型。按计划8月底先推出阶段性版本,重点提升代码能力与Token性价比。
X 热议
5 条
有观点指 Ox Alpha 接近智谱 GLM-5.3 的压缩与视觉版
DeepSeek 圈评论者 Teortaxes 认为 Ox 文本能力大致相当于 GLM-5.3,真正意外的是很快补上还算能用的视觉并做了压缩。若属实,说明该系列在公开露面之前已训练较长时间。
NVIDIA AVO 在 ARC-AGI-3 公开集报 100%,争论转向“测的是模型还是脚手架”
NVIDIA 称通用编程智能体 AVO 在 ARC-AGI-3 公开集 25 个环境、183 关全部通过,而同一 Claude Opus 5 单模型大约只有三成。有评论指出满分可能更快淘汰该基准,因为它更像在考 harness、记忆与监督回路。
Sundar Pichai:Gemini 3.7 Flash 已接入 Search 与 Gemini App
谷歌 CEO 称 Gemini 3.7 Flash 首周增速超过以往 Gemini 机型,并已进入 Search 与 Gemini App。ARC Prize 同期给出该模型在 ARC-AGI-2 上 84.6%、单任务约 0.25 美元的数据。
Anthropic 免费学习站 Claude Academy 继续在开发者圈传播
Claude Academy(academy.claude.com)提供从日常使用、Claude Code 到 API/MCP 与智能体的免费课程,并可领取完成徽章。中小团队把它当作可外置的入职教材,而不是又一套文档站。
Inherent 发布 Faraday:声称在复现科研论文任务上超过头部闭源模型
由 DeepMind 校友创立的英国实验室 Inherent 推出科研向智能体 Faraday,TechCrunch 报道其在复现论文实验上的表现超过 Anthropic 与 OpenAI 对照系统。讨论集中在“科研队友”是否可复现,而不只是聊天分数。
GitHub 项目
4 条
Supabase MCP 迁到 MCP SDK v2,发布 mcp-server-supabase 0.11.0
supabase/mcp 在 8 月 20 日发布 mcp-server-supabase v0.11.0 与 mcp-utils v0.7.0,peer 依赖改为 @modelcontextprotocol/server,并增加双时代包入口。升级时需按 breaking change 调整 handler 注册方式,适合已把 Claude Code 接到 Supabase 的项目评估迁移。
wshobson/agents 持续更新:多 harness 的 Agent 插件市场
wshobson/agents 在 8 月 22 日仍有提交,面向 Claude Code、Codex、Cursor、OpenCode、GitHub Copilot 等提供可安装的 agentic plugin。仓库把技能、子代理和工作流打包成可跨工具复用的插件市场,适合对照自己的多 Agent 编排方案。
FastMCP 4.16.8:边缘重放与断线重连修复
punkpeye/fastmcp 于 8 月 21 日连发 4.16.6 到 4.16.8,修复边缘传输里重放流冲突、断线补齐事件以及会话已结束后的游离重放。用 TypeScript 写 MCP server、并给 Claude Code 暴露工具的开发者可按补丁升级。
AI-Infra-Guard:腾讯开源 AI 红队与基础设施扫描
覆盖 Agent、Skills、MCP、AI 基础设施扫描与越狱评测,可用于自查 Agent 生态风险。近期版本加强了 Skill 扫描与 MCP 动态检测。
开源产品
5 条
OpenCode 发布 v1.18.21 开源编程助手
OpenCode 是可本地运行的开源编程 Agent,提供终端与桌面端,支持自带密钥与多种模型后端。v1.18.21 于 8 月 21 日发布,改进未知 finish reason 时的续写、Vertex AI 多区域路由,并修复桌面端文件搜索与归档命令。
Capka 发布 v0.31.0:可自托管的沙箱 AI 同事
Capka 是开源、可用 Docker 自部署的 AI 同事产品,提交任务与文件后会交回报告、表格或补丁,每个任务在独立 Linux 沙箱中执行。8 月 21–22 日连续发布 0.29.0 与 0.31.0,补充运行时预算、工具输出上限和工作区 zip 下载等运维能力。
Big-AGI Open 2.1.0:自托管多模型聊天工作区
Big-AGI Open 是可自托管的专业聊天与推理工作区,支持多家模型供应商与本地部署。2.1.0 于 8 月 21 日发布,新增 Cerebras、NVIDIA NIM、Sakana、Cohere 等接入,并覆盖 GPT-5.6、Kimi K3、DeepSeek V4 等模型及多厂商转写。
Nexa SDK v0.5.0:本机运行 LLM 的 CLI 与兼容服务
Nexa 提供本机 CLI、OpenAI 兼容服务与界面,可在消费级设备上跑文本、视觉与语音模型。v0.5.0 于 8 月 22 日发布,带来 Snapdragon 上免导证书的 Hexagon HTP 目录,并增强 Gemma 4 工具调用与推测解码统计。
Krita AI Diffusion 1.53.0:在 Krita 内做可控图像生成
该插件把扩散模型接到 Krita 绘画流程,支持局部重绘、扩图与多种控制层,并可连接本地 ComfyUI 或托管服务。1.53.0 于 8 月 22 日发布,加入 Anima 分割控制,托管服务升级到 CUDA 13 与 PyTorch 2.13,并支持 int8/int4 模型。
报告观点
4 条
SWE-bench Science:科学软件工程任务上编码智能体的评测
复旦与上海创智学院提出覆盖20个科学领域、119个仓库级任务的基准,检验编码智能体能否在真实科学软件仓库中完成修复。Claude Code 搭配 Opus-5 的 pass@1 仍低于50%,并归纳出科学知识缺口、浅层修复与集成不完整等失败模式。
EnvHarness:用可编程插件改写静态环境以促进智能体学习
论文提出在不改底层逻辑的前提下,用插件层重塑静态环境的初始状态、交互接口与复合任务。在四个领域五个基准上,相对原环境与专用环境生成管线,留出实例上提升约9分,并减少约9.8%执行步数。
MemTrapBench:评测大模型使用记忆时的认知陷阱
研究发现即使记忆记录准确且语义相关,仍可能造成推理固着与信念扭曲,从而拉低当前任务表现。在两个模型家族与五种记忆框架上,所有带记忆策略均弱于无记忆基线,较强方法也下降超过10个百分点;作者提出推理时的AdaptiveMem缓解该问题。
Phantom Gains:用对照实验审计语言模型自我改进指标
作者在Qwen3-8B上对三轮LoRA自训练做对照审计,指出七类测量失效会把未训练模型也判成能力变化。修正后的逐题精确检验显示,外部蒸馏能改善基座很少触及的题目,而三种自训练则基本没有这一效果。
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。