09.08
2026-09-08 · 星期二 · 06:21 截稿 · 覆盖近 1-3 天动态
今天在动的不是又一个模型名,而是 agent 被拆成可外包的工人:Claude Code、Codex、Gemini 能经 MCP 互相当审查或实现端,一份配置把技能同步到多套客户端,正文还能从远程库按需拉取。榜单上 Astra 与 Fable 5.1 打平,开源 Flash 用大约两成单任务成本拿到相近分数,通义上了 Qwen3.8-Max 快照,端侧则放出 MiniCPM5-2B,讨论已经从谁更强滑向谁更便宜、能不能自建。换模型时记忆未必跟着走——压缩笔记绑写入模型,固定结构的图谱更稳。社交上同时在传 Astra 从频谱认声、一次出可打印零件,以及有人把直播交给它连轴转,演示热度和日常工作流能否接上还不是一回事。
产品发布
3 条
阿里云上线 Qwen3.8-Max-0902 快照
通义千问在百炼上线 qwen3.8-max-0902 快照,沿用 2.4T MoE 与约 1M 上下文,强化工程级编程、长程自主开发、多工具协作与原生视觉。模型 ID 为 qwen3.8-max-0902,可通过阿里云 Model Studio API 调用。
OpenBMB 发布端侧模型 MiniCPM5-2B
OpenBMB 于 9 月 7 日开源 MiniCPM5-2B,约 2.6B 稠密参数、Apache 2.0 许可,面向端侧与资源受限部署,支持长上下文与工具调用。权重已上线 Hugging Face 与 ModelScope,并提供 GGUF、MLX 等部署格式。
微软在 Foundry 预览 MAI-Image-2.6-Flash
微软将 MAI-Image-2.6 与轻量变体 MAI-Image-2.6-Flash 放入 Microsoft Foundry 公开预览,支持多图参考编辑、网页 grounding 与动态宽高比。Flash 面向低延迟高吞吐场景,文本/图像输入与图像输出单价较主模型下调。
X 热议
6 条
Artificial Analysis发布Intelligence Index v4.3:Astra与Fable 5.1并列领先
新指数升级Terminal-Bench 4.0并加入Zapier工作流基准AutomationBench-AA。GPT-6 Astra与Claude Fable 5.1均得53分,开源权重侧GLM-5.3与Kimi K3以44分领跑,同分模型成本差可达数倍。
Together AI对比:GLM-5.3 Flash与GPT-5.6 Terra同分,单任务成本低约82%
双方在Artificial Analysis智力指数上同为42分,但Flash单任务成本约 Terramax 的18%。开发者讨论开始从“谁更强”转向性价比与自建栈。
开发者实测:Astra零样本从梅尔频谱识别声音,Gdb转发称尚未摸到能力边界
Max展示Astra在轻推理档即可从spectrogram识别声源,OpenAI总裁转发。另一条高互动帖则记录它根据洗手槽堵发视频在Fusion 360里参数化建模并一次打印成功。
Matt Shumer称GPT-6 Pro“像怪物”,并公开Astra三维场景搭建方法
他指出Pro档讨论偏少,同时分享Astra生成可交互3D场景的流程,相关演示累计浏览量已过千万级。评论区多在追问提示词结构、Blender/Three.js衔接与额度消耗。
ChatGPT Work上线写作风格迁移:从邮件与文档里学习个人文风
官方展示可连接Gmail、Drive、Slack、SharePoint,提取惯用措辞、落款与大小写习惯并用于后续写作。Greg Brockman转发后,企业文档工作流成为当天讨论焦点。
主播N3on宣布用GPT-6 Astra做不间断AI直播,自称“最后一场人类直播”
N3on称将交给Astra与Higgsfield驱动24小时直播,本人下播睡觉。圈内争论集中在创作者分身、内容同质化以及模型实时控场是否可靠。
GitHub 项目
8 条
mcp-agents:Claude Code 与 Codex 双向 MCP 桥接
把 Claude Code、Codex CLI 和 Gemini CLI 封装成 MCP 工具,让任一客户端把另一套 agent 当审查或实现工人调用。仓库在 2026-09-07 仍有提交,适合多 agent 互评与长任务委托。
rtk:压缩常见开发命令输出以节省 Token 的 CLI 代理
Rust 单文件 CLI 代理,对常见开发命令的终端输出做过滤与压缩后再交给 LLM。零额外运行时依赖,适合在 Agent 循环里降低上下文体积。
Experiential:零加价 BYOK 多模型网关
开源模型网关,支持自带 Key、自托管及市场上千种模型接入,并按流量学习以推荐更省成本的路由。近日随 Agent 工具链一起进入热榜,适合搭建统一模型入口。
easy-agnostic:一套 MCP/Skill 配置同步到多 agent
2026-09-07 新工具,用一份 mcp.json 把 MCP 服务器和 skills 同步到 Claude Code、Codex、Pi,三路合并不覆盖手工改动,密钥只存引用。适合同时维护多套 coding agent 的团队工作流。
agent-skills-mcp:远程下发 SKILL.md 的 MCP Server
2026-09-07 新仓库,用 list_skills / get_skill 从数据库按需把技能正文交给 Claude,本机再执行。技能可改库而不用重新部署,适合把团队 SKILL.md 做成可检索的远程目录。
smart-screenshot:移动端截图与 UI 层级 Claude Code Skill
2026-09-07 新仓库,提供 /smartScreenshot 与 /processSmartScreenshot,把 Android/iOS 模拟器画面导出为 PNG+XML 层级并可标注。适合用 Claude Code 做移动端 UI 走查和改稿。
wayfinder:会话航线图 Skill 与 MCP App
2026-09-07 发布的本地会话地图,记录提示、改动、分支与结论,带 Claude/Codex 插件、Agent Skill、MCP App 和终端树视图。用来回看一次 coding session 的决策路径,而不改真实 git 历史。
broomva/skills:兼容 Claude Code 的跨端 Skill 单仓
按 agentskills.io 布局的 skill 单仓,可用 npx skills add broomva/skills 按名称安装,覆盖编排、记忆、研究、设计等类别。2026-09-07 仍有推送,适合当作可拆装的工作流模板库。
开源产品
5 条
Agent Teams AI 2.13 支持运行中改队友与多供应商模型
Agent Teams AI 于 2026-09-07 连续发布 2.13.0–2.13.2,可本机运行多 Agent 团队并打包桌面安装包。2.13.0 允许不重启就改队友设置与主模型、预览任务附件;后续补丁修复 Z.AI Coding Plan 与 OpenCode 启动校验,避免团队无法拉起。
Open Science 0.26.0:科研工作台接入 Slurm 与文献库
Open Science 于 2026-09-07 发布 v0.26.0,这是可在 macOS/Windows/Linux 本地运行的开源科研 AI 工作台。远程计算主机可按主机选择 SSH 或 Slurm 提交笔记本任务,并新增参考文献、PDF 与引文管理库,内置模型目录同步 GPT-6 Astra、Claude Fable 5.1。
PyGPT 2.8.10 加入 Agents v2 多代理编排
桌面开源助手 PyGPT 于 2026-09-06 发布 2.8.10,新增 Agents v2(beta):由 Orchestrator 动态创建专家 worker,支持并发生命周期、本地工具、RAG 与原生函数调用。同日 2.8.11 补充 Coder/Researcher/Scientist/Brainstorm 预设。
ComfyUI 打出 v0.34.6 标签,节点图后端持续周更
ComfyUI 于 2026-09-07 打出 v0.34.6 标签,属于 0.34 线的小版本迭代,保持节点图界面、API 与后端可本地部署。该版本主要跟随前端包与节点生态更新,适合已在用 ComfyUI 的图像/视频工作流跟进。
InvokeAI 6.14.1 修复并补齐 6.14 图像工作流
可自托管的图像生成套件 InvokeAI 于 2026-09-06 发布 6.14.1,在 6.14.0 的视频生成与多 GPU 能力之上修复若干工作流问题,并加入工作流截图导出、画廊中键行为调整及 Krea-2 LoRA 支持。适合已部署 6.14 线的团队跟进补丁。
报告观点
4 条
ACE:无需校准的MoE专家跳过方法,可在推理时减少冗余计算
论文提出训练无关、无需校准且不改权重的ACE框架,用全局谱代理与路由条件 refinement 判断低贡献专家并跳过,同时保留top-1专家。在三款MoE模型和八项基准上,较高跳过比例下困惑度与下游准确率优于对比方法。
CUA-Universe:可规模化的GUI与命令行混合计算机使用Agent环境
作者提出把真实桌面软件转为混合GUI+CLI环境的流水线,覆盖16款应用并合成可控难度任务。用该数据训练的9B模型在自建评测及OSWorld上同时提升成功率,并减少步数与token消耗。
Agent记忆在模型升级后能否迁移:对照实验给出结构差异
研究比较原文长上下文、RAG分块、模型压缩笔记与固定schema知识图谱在更换模型后的表现。固定结构图谱迁移较稳,压缩笔记对写入模型耦合强,部分embedding混用只能拿到完整重嵌入收益的一小部分。
研究发现大语言模型会利用置信信号决定是否作答
Nature Machine Intelligence刊文显示,增强或抑制模型内部置信相关信号,会改变其决定作答还是弃权的行为。该结果为校准、拒答机制和可靠性评估提供了可干预的因果证据。
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。