AI 资讯
每天一轮 AI 检索:GitHub 项目、开源产品、X 热议、报告观点——条条带源链接,死链不上桌。
NO.048
09.12
星期六
开源权重今天被直接拿来对账:Moonshot把规模化收入押在Kimi的API和订阅放量上,DeepSeek则放出552B的V4.1-Flash,用非对称激活去压KV cache和agent缓存成本。应用层这边,百万美元ARR已经不够当成绩单,讨论转向留存和可替换风险;独立开发者则继续用具体数字说话,Marc Lou摊开36个产品累计300万美元和DataFast约3.08万美元MRR,glasa用提前养好的名单换来首周1.3万美元。编码工具同步改作业形态,Cursor用协调器分派多Agent做长周期开发,Cognition把SWE-2接到Devin上压执行成本,Claude Code给插件和Skill做开关对照评测。
26 条
Artificial Analysis发布Intelligence Index v4.3:Astra与Fable 5.1并列领先
新指数升级Terminal-Bench 4.0并加入Zapier工作流基准AutomationBench-AA。GPT-6 Astra与Claude Fable 5.1均得53分,开源权重侧GLM-5.3与Kimi K3以44分领跑,同分模型成本差可达数倍。
阿里云上线 Qwen3.8-Max-0902 快照
通义千问在百炼上线 qwen3.8-max-0902 快照,沿用 2.4T MoE 与约 1M 上下文,强化工程级编程、长程自主开发、多工具协作与原生视觉。模型 ID 为 qwen3.8-max-0902,可通过阿里云 Model Studio API 调用。
ACE:无需校准的MoE专家跳过方法,可在推理时减少冗余计算
论文提出训练无关、无需校准且不改权重的ACE框架,用全局谱代理与路由条件 refinement 判断低贡献专家并跳过,同时保留top-1专家。在三款MoE模型和八项基准上,较高跳过比例下困惑度与下游准确率优于对比方法。
Together AI对比:GLM-5.3 Flash与GPT-5.6 Terra同分,单任务成本低约82%
双方在Artificial Analysis智力指数上同为42分,但Flash单任务成本约 Terramax 的18%。开发者讨论开始从“谁更强”转向性价比与自建栈。
mcp-agents:Claude Code 与 Codex 双向 MCP 桥接
把 Claude Code、Codex CLI 和 Gemini CLI 封装成 MCP 工具,让任一客户端把另一套 agent 当审查或实现工人调用。仓库在 2026-09-07 仍有提交,适合多 agent 互评与长任务委托。
rtk:压缩常见开发命令输出以节省 Token 的 CLI 代理
Rust 单文件 CLI 代理,对常见开发命令的终端输出做过滤与压缩后再交给 LLM。零额外运行时依赖,适合在 Agent 循环里降低上下文体积。
开发者实测:Astra零样本从梅尔频谱识别声音,Gdb转发称尚未摸到能力边界
Max展示Astra在轻推理档即可从spectrogram识别声源,OpenAI总裁转发。另一条高互动帖则记录它根据洗手槽堵发视频在Fusion 360里参数化建模并一次打印成功。
CUA-Universe:可规模化的GUI与命令行混合计算机使用Agent环境
作者提出把真实桌面软件转为混合GUI+CLI环境的流水线,覆盖16款应用并合成可控难度任务。用该数据训练的9B模型在自建评测及OSWorld上同时提升成功率,并减少步数与token消耗。
OpenBMB 发布端侧模型 MiniCPM5-2B
OpenBMB 于 9 月 7 日开源 MiniCPM5-2B,约 2.6B 稠密参数、Apache 2.0 许可,面向端侧与资源受限部署,支持长上下文与工具调用。权重已上线 Hugging Face 与 ModelScope,并提供 GGUF、MLX 等部署格式。
Experiential:零加价 BYOK 多模型网关
开源模型网关,支持自带 Key、自托管及市场上千种模型接入,并按流量学习以推荐更省成本的路由。近日随 Agent 工具链一起进入热榜,适合搭建统一模型入口。
Matt Shumer称GPT-6 Pro“像怪物”,并公开Astra三维场景搭建方法
他指出Pro档讨论偏少,同时分享Astra生成可交互3D场景的流程,相关演示累计浏览量已过千万级。评论区多在追问提示词结构、Blender/Three.js衔接与额度消耗。
Agent记忆在模型升级后能否迁移:对照实验给出结构差异
研究比较原文长上下文、RAG分块、模型压缩笔记与固定schema知识图谱在更换模型后的表现。固定结构图谱迁移较稳,压缩笔记对写入模型耦合强,部分embedding混用只能拿到完整重嵌入收益的一小部分。
easy-agnostic:一套 MCP/Skill 配置同步到多 agent
2026-09-07 新工具,用一份 mcp.json 把 MCP 服务器和 skills 同步到 Claude Code、Codex、Pi,三路合并不覆盖手工改动,密钥只存引用。适合同时维护多套 coding agent 的团队工作流。
ChatGPT Work上线写作风格迁移:从邮件与文档里学习个人文风
官方展示可连接Gmail、Drive、Slack、SharePoint,提取惯用措辞、落款与大小写习惯并用于后续写作。Greg Brockman转发后,企业文档工作流成为当天讨论焦点。
Agent Teams AI 2.13 支持运行中改队友与多供应商模型
Agent Teams AI 于 2026-09-07 连续发布 2.13.0–2.13.2,可本机运行多 Agent 团队并打包桌面安装包。2.13.0 允许不重启就改队友设置与主模型、预览任务附件;后续补丁修复 Z.AI Coding Plan 与 OpenCode 启动校验,避免团队无法拉起。
研究发现大语言模型会利用置信信号决定是否作答
Nature Machine Intelligence刊文显示,增强或抑制模型内部置信相关信号,会改变其决定作答还是弃权的行为。该结果为校准、拒答机制和可靠性评估提供了可干预的因果证据。
Open Science 0.26.0:科研工作台接入 Slurm 与文献库
Open Science 于 2026-09-07 发布 v0.26.0,这是可在 macOS/Windows/Linux 本地运行的开源科研 AI 工作台。远程计算主机可按主机选择 SSH 或 Slurm 提交笔记本任务,并新增参考文献、PDF 与引文管理库,内置模型目录同步 GPT-6 Astra、Claude Fable 5.1。
agent-skills-mcp:远程下发 SKILL.md 的 MCP Server
2026-09-07 新仓库,用 list_skills / get_skill 从数据库按需把技能正文交给 Claude,本机再执行。技能可改库而不用重新部署,适合把团队 SKILL.md 做成可检索的远程目录。
微软在 Foundry 预览 MAI-Image-2.6-Flash
微软将 MAI-Image-2.6 与轻量变体 MAI-Image-2.6-Flash 放入 Microsoft Foundry 公开预览,支持多图参考编辑、网页 grounding 与动态宽高比。Flash 面向低延迟高吞吐场景,文本/图像输入与图像输出单价较主模型下调。
PyGPT 2.8.10 加入 Agents v2 多代理编排
桌面开源助手 PyGPT 于 2026-09-06 发布 2.8.10,新增 Agents v2(beta):由 Orchestrator 动态创建专家 worker,支持并发生命周期、本地工具、RAG 与原生函数调用。同日 2.8.11 补充 Coder/Researcher/Scientist/Brainstorm 预设。
主播N3on宣布用GPT-6 Astra做不间断AI直播,自称“最后一场人类直播”
N3on称将交给Astra与Higgsfield驱动24小时直播,本人下播睡觉。圈内争论集中在创作者分身、内容同质化以及模型实时控场是否可靠。
ComfyUI 打出 v0.34.6 标签,节点图后端持续周更
ComfyUI 于 2026-09-07 打出 v0.34.6 标签,属于 0.34 线的小版本迭代,保持节点图界面、API 与后端可本地部署。该版本主要跟随前端包与节点生态更新,适合已在用 ComfyUI 的图像/视频工作流跟进。
smart-screenshot:移动端截图与 UI 层级 Claude Code Skill
2026-09-07 新仓库,提供 /smartScreenshot 与 /processSmartScreenshot,把 Android/iOS 模拟器画面导出为 PNG+XML 层级并可标注。适合用 Claude Code 做移动端 UI 走查和改稿。
wayfinder:会话航线图 Skill 与 MCP App
2026-09-07 发布的本地会话地图,记录提示、改动、分支与结论,带 Claude/Codex 插件、Agent Skill、MCP App 和终端树视图。用来回看一次 coding session 的决策路径,而不改真实 git 历史。
broomva/skills:兼容 Claude Code 的跨端 Skill 单仓
按 agentskills.io 布局的 skill 单仓,可用 npx skills add broomva/skills 按名称安装,覆盖编排、记忆、研究、设计等类别。2026-09-07 仍有推送,适合当作可拆装的工作流模板库。
InvokeAI 6.14.1 修复并补齐 6.14 图像工作流
可自托管的图像生成套件 InvokeAI 于 2026-09-06 发布 6.14.1,在 6.14.0 的视频生成与多 GPU 能力之上修复若干工作流问题,并加入工作流截图导出、画廊中键行为调整及 Krea-2 LoRA 支持。适合已部署 6.14 线的团队跟进补丁。
25 条
OpenAI 工程师:Astra 低推理档已强于上代高推理,建议下调 effort
Codex 团队成员 Tibo 称 GPT-6 Astra 在 low 推理设置下的表现已优于 GPT-5.6 Sol 的 high。此前习惯开高推理的开发者可考虑下调,以降低延迟和额度消耗。
OpenClaw 发布 2026.9.2 可自托管个人助手
OpenClaw 于 2026-09-05 发布 2026.9.2,优化长会话下聊天与控制台响应,并加强自动升级与 Gateway 恢复。该版本支持接入 GPT-6 Astra,可用 Docker 或本机安装作为完整个人 AI 助手。
一周四家实验室连发新模型,X 上热传“模型疲劳”
本周 Anthropic Fable/Mythos 5.1、Meta Muse Spark 1.3、Google Gemini 3.8 Flash 与 OpenAI GPT-6 Astra 密集上线。开发者反映评测、接口和定价差异增大,选型与回归测试成本上升。
通义千问上线Qwen3.8-Max-0902快照
阿里云百炼将Qwen3.8-Max更新为0902快照,面向工程级编码、多工具编排与多模态文档理解,保持约100万token上下文。国际区API约为输入2美元、输出6美元/百万token,国内与部分区域价更低。
TrustMRR 核验:单人做的广告 Agent Adspirer 近 30 天收入 7.02 万美元
Adspirer 把 Google/Meta/TikTok 等广告账户接到 MCP,让对话式 AI 管投放;TrustMRR 显示近 30 天核验收入 70,229 美元、742 个有效订阅、当前 MRR 约 5.47 万美元、利润率 82%。年付套餐从 485 美元到 2000 美元。
oh-my-openagent:多 Agent 编排插件,兼容 Claude Code 的 skills/hooks/MCP
开源 Agent 编排系统,主控可把任务分给规划与深挖子代理,并内置 Context7、Exa 等 MCP。对 Claude Code 支持 hooks、commands、skills 与按需拉起的 skill-embedded MCP,适合做可复用的多代理工作流。
Manus 恢复独立运营:知情人士称 ARR 已到 4–5 亿美元区间
36氪援引报道:通用 Agent 产品 Manus 于 9 月初宣布恢复独立运营,创始团队继续掌舵。知情人士向《金融时报》透露,年化经常性收入从被收购时约 1 亿美元升至约 4–5 亿美元。
OpenAI 研究负责人撰文《An Alien Mind》,谈对齐失效与递归自我改进
Jakub Pachocki 认为规模化长出的智能与人类心智不同,思维链监控正在变弱,实验室尚不足以按最高速度继续扩张。文章呼吁把对齐、防御系统与国际协调放在更优先位置。
Anthropic用多智能体在11天内完成费马大定理的Lean形式化
Anthropic于9月4日发布技术报告:一组Claude智能体在约11天内写出约1300万行Lean代码,并得到可用核验器复现的费马大定理证明。工作重点是自动形式化与验证吞吐,沿用已有Wiles路线而非给出新的数学论证。
Graphify:把代码库与文档转成可查询知识图谱的 Agent Skill
用本地 AST 解析把代码、文档、SQL schema、配置和 PDF 建成知识图谱,不依赖向量库。可作为 Claude Code、Cursor、Codex、Gemini CLI 的 /graphify 技能使用。
LoopX 1.0 发布长程 Agent 工作区
LoopX 于 2026-09-06 发布 v1.0.0,提供可本地部署的 Personal Workspace,用于查看长程 Agent 进度、交接与交付证据。它运行在 Codex、Claude Code、Cursor 等 harness 之上,并提供中文文档与桌面预览包。
Playwright Agent Skill:把 E2E/API/无障碍测试指南做成可按需加载的 SKILL.md
TestDino 把 70 份 Playwright 实践指南打包成 Agent Skills,覆盖调试、Page Object、CI 与迁移。可用 npx skills add testdino-hq/playwright-skill 装进 Claude Code,按任务按需加载对应指南。
开源大模型商业化跟踪:国内核心 LLM 年化收入约 60–80 亿美元
ChainCatcher 转发 9 月 1 日 China Open-Source LLM Tracker:剔除部分业务后核心大模型收入约 60–80 亿美元。文中给出智谱、MiniMax、Kimi、DeepSeek 等分项年化口径,并提到涨价后用量仍在上升。
Vals 评测:Muse Spark 1.3 Max 接近 Fable 5 与 Sol,推理成本低数倍
Vals AI 指数显示 Meta Muse Spark 1.3 Max 与 Claude Fable 5、GPT-5.6 Sol 表现接近,价格约为后两者的四分之一到八分之一。Meta 相关负责人转发后,性价比选型成为讨论点。
建筑师渲染工具 Visualizee:界面改成对话后做到约 8200 美元 MRR
Starter Story 采访创始人 Piotr:AI 建筑/室内渲染产品 Visualizee 长期卡在约 150 美元/月,把复杂节点界面改成对话流后,付费用户约 300、MRR 约 8200 美元,含一次性付款月入约 1 万美元。
Paytm 创始人:2026 年底个人 Agent 将走向大众,系统级开放是门槛
Vijay Shekhar Sharma 预计苹果会向受信任 Agent 开放系统能力,Android 也需对等开放第三方 Agent。他认为机构会在 2027 年像当年做网站和 App 一样大规模上线 Agent。
oh-my-harness:一句话生成 CLAUDE.md、hooks 与 settings 护栏
用自然语言描述项目约束,npx oh-my-harness init 会生成 CLAUDE.md、分支/TDD/命令拦截 hooks 和 settings。可用 omh sync --check 在 CI 里检测护栏文件漂移,属于可复制的 agent 工作流模板。
InvokeAI 6.14.1 更新本地图像生成套件
InvokeAI 于 2026-09-06 发布 6.14.1,可在本机部署完整图像与视频生成工作台。此版本修复若干问题,并加入工作流截图、Krea-2 LoRA 支持及阿里云图片下载相关安全处理。
legwork-skill:给 Claude Code/Codex 的决策研究技能,每条结论都标证据强度
DBHQ 开源的研究型 skill,要求多源交叉核验、引用可回溯,并在证据不够时明确写“无法判定”。可按 Claude Code 插件安装,输出带证据日志的 Markdown 报告,适合调研与方案评审工作流。
HumanLayer Skills:可复用的 Agent 工作流技能库
HumanLayer 团队维护的 Agent Skills 仓库,面向可插拔工作流与人机确认场景。近 48 小时多次上榜,当日仍有约 450 Star 增量。
shell-forensics:从 Claude Code/Codex 会话记录里挖出全部 shell 命令
这是一份 Claude Code skill,只读扫描 Claude Code、Codex、OpenCode、Cursor 落盘的 transcript,抽出 shell、失败原因和修复路径。可输出带统计的 HTML 报告,用来复盘 agent 真正怎么用终端。
DSkills:面向 Claude Code/Codex/Gemini CLI 的 CLI 工具技能包
把搜索、文档拉取、任务委派、GitHub 趋势分析等能力做成可安装 skill,支持 Claude Code 插件市场与本地 skill 目录。部分技能走 CLI/MCP,适合给编码 agent 补外部工具而不是把流程全写进提示词。
Agenvoy v0.35.4 更新单二进制自托管 Agent
Agenvoy 于 2026-09-06 发布 v0.35.4,以单个 Go 二进制在本机完成研究、文件处理与自动化。本版增加报告输出与应用内文档预览,并可通过 MCP 向 Claude Code、Codex 等客户端共享沙箱工具。
Libre WebUI v0.34.0 更新本地 AI 工作区
Libre WebUI 于 2026-09-05 发布 v0.34.0,可用 Docker 或 CLI 自托管聊天、文档检索与隔离 Agent 工作区。本版加入 ollama launch 启动方式,并支持通过 ChatGPT 登录接入 GPT-6 Astra 等模型。
AgentOS 2026.9.6 发布本地优先交易 Agent
AgentOS 于 2026-09-06 发布 2026.9.6,可在本机通过 Web UI、CLI 与聊天渠道运行带路由的 Agent。本版集中修复 MCP 传输与会话泄漏问题,并支持 OpenRouter、Ollama、DeepSeek、Qwen 等模型源。
22 条
SGLang 发布 v0.5.19,新增 Qwen3.8 等模型与 Beam Search
SGLang 于 2026-09-05 发布 v0.5.19,合入 786 个 PR,新增 Qwen3.8、Ling-3.0、Granite 4.2 等模型支持,并加入 beam search。可作为自托管推理服务部署,覆盖消费级 GPU 到集群场景。
Magnitude:按硬件自动选型的本地推理服务
开源本地推理服务器,会探测本机硬件并推荐合适模型,再接入已有编码 Agent。可降低 token 成本,适合需要离线或自托管推理的团队。
GPT-6 Astra 在 Code Arena WebDev 取得领先分数
@arena 公布 GPT-6 Astra (Max) 在 Code Arena: WebDev 拿到 1797 分,高于 Claude Fable 5.1 (Max) 的 1762 分,并称其在约 40 美元/百万 token 价位改写帕累托前沿。该结果主要覆盖多步工具调用与网页开发类任务。
NVIDIA以129.3亿美元收购Hugging Face,平台保留开放生态
NVIDIA官方宣布以129.303亿美元收购Hugging Face,黄仁勋称平台继续对全行业开放,不强制使用NVIDIA算力。官方数据称平台有超1800万开发者、超300万模型、50万数据集、100万应用,并有超20万家公司使用。
Terminal-Universe:把Agent轨迹还原成可复用终端环境
论文指出终端代码Agent的轨迹很多,但可供后训练的可执行环境很少。Terminal-Universe从轨迹中的文件操作回放工作区,补全缺失依赖后既可还原原任务,也可合成新的可验证交互任务。
Open Interpreter 发布 rust-v0.0.41,同步 Codex 并强化开源模型 Harness
Open Interpreter 于 2026-09-05 发布 rust-v0.0.41,同步 Codex rust-v0.153.4 并提供跨平台安装包。当前 Rust 版面向本地/低成本模型,内置 kimi-code 等 harness,可用一条命令在本机跑编码与电脑操作 Agent。
微软与康奈尔提出 Free Pause Tokens
DAIR.AI 转发 Microsoft/Cornell 论文:用并行预测流承载额外计算,不增加上下文长度与 KV cache。1B 模型上 next-token 预测约提升 2–3 centinats,训练开销可压到约 1.14 倍。
智谱与MiniMax中报:API成为主引擎,8月ARR分别到16亿与8亿美元
极客公园根据两家港股中报与业绩会梳理:智谱上半年营收9.54亿元、开放平台及API收入8.25亿元占比86.5%,管理层称8月末ARR约16亿美元;MiniMax上半年营收1.17亿美元,8月ARR超8亿美元,B端约占ARR的80%,企业和开发者客户超200万。
Xiaomi-TabLDM:表格基础模型技术报告
小米提出面向分类与回归的表格基础模型Xiaomi-TabLDM,仅用结构因果模型生成的合成数据预训练,通过上下文学习完成预测而无需任务微调。报告还讨论了合成数据覆盖、容量扩展与测试时计算缩放。
Langfuse 发布 v4.30.0,自托管 LLMOps 平台重做评测结果表
Langfuse 于 2026-09-04 发布 v4.30.0,按分数列重建实验/评测结果表,并增加 worse-than 过滤与按 run 的分数矩阵。该平台可自托管,覆盖追踪、评测、提示词与数据集管理。
xAI 上线 Grok Imagine Video 1.5 Agent
@grok 宣布 Imagine Video 1.5 Agent 上线,基于 Image 2.0,强调多镜头衔接与叙事连贯,并可在 grok.com 及移动端使用。Arena 随后给出该版本在 Text-to-Video 榜约 1491 分、与 Wan-3.0 / FLUX 3 Video 接近的成绩。
腾讯WorkBuddy开放平台上线,开放Agent基座能力
腾讯WorkBuddy开放平台于9月2日上线,面向硬件、行业应用和开发者开放Buddy应用、Skill、专家、连接器与硬件接入。首批超百家伙伴入驻,现场发布9款联名硬件,并接入30余个行业应用。
OpenCode:开源编码 Agent
社区驱动的开源编码 Agent,内置 build 与 plan 两类代理,支持文件编辑、命令执行与子代理搜索。作为闭源编码助手的替代方案,近两日热度继续上升。
安全研究者质疑 Astra 关闭 reasoning=None 不利于可监测性
Redwood Research 的 Ryan Greenblatt 指出,OpenAI 不向公众开放 Astra 的 reasoning=None,虽可能出于越狱或防蒸馏考虑,但会阻碍外部研究无 CoT 能力与潜伏推理。他建议设立门槛较低的研究者 API 权限。
OpenCode 发布 v1.18.29,修复订阅账号下 GPT 模型筛选
开源编码 Agent OpenCode 于 2026-09-04 发布 v1.18.29,修复 Codex OAuth 对整数版 GPT 型号的过滤,使 gpt-6-astra 等模型能在订阅账号中显示。该工具支持多模型与本地/自托管使用,面向日常编码代理场景。
n8n 发布 2.37.10,可自托管的 AI 自动化平台小版本更新
n8n 于 2026-09-04 发布稳定版 2.37.10,并同步打上 stable 标签。该产品可用 Docker 自托管,把大模型节点接入业务流程、Webhook 与内部系统,适合搭建可落地的 AI 自动化。
Windmill 发布 v1.804.0,自托管低代码 AI 工作流平台更新助手与 Agent 表单
Windmill 于 2026-09-05 发布 v1.804.0,将 AI 会话上下文面板改为助手设置弹窗,并支持将 Agent 表单分组、以草稿方式编辑已保存 Agent。该版本可 Docker 自托管,适合把脚本编排成带 AI 能力的内部工作流与界面。
创始人公开GainFrame做到2173美元MRR:AI体脂追踪连续12天日入超100美元
开发者@mjrode在X上按日更新,Day 39显示GainFrame MRR为2173美元,并称连续12天单日收入超过100美元。第三方Grewit帖文引用RevenueCat同步数据称该AI体态/体脂追踪应用约344个有效订阅、近30天收入3270.82美元。
David Sacks:AI 政治争论转向开源分散 vs 闭源集中
All-In 联合主持人 David Sacks 称,政策辩论焦点正从加速派与末日派,转向去中心化/开放与中心化/封闭两条路线。该帖配有视频,互动集中在监管与开源权重的取舍。
Activepieces 发布 0.90.2,自托管自动化平台加强 Agent 与 HTTP 步骤
Activepieces 于 2026-09-04 发布 0.90.2,改进 HTTP 请求步骤表单,为 Tally 增加 agent atomics,并修复新安装 piece 后流程报 piece-not-found 等问题。可用 Docker 一键自托管,作为带 Agent 能力的开源自动化后台。
Foundry:Foreman / Hush / Razor 三件套 Claude Code 插件
出现在 2026-09-05 的技能热榜。一个 marketplace 里装三个插件:把计划写进仓库、压缩啰嗦输出、拦不必要的加依赖。适合当轻量 Agent 工作流起点。
Sabine Hossenfelder:有人出价让其渲染 AI 恐慌
物理学家 Sabine Hossenfelder 发帖称曾被出价去吓唬公众害怕 AI,并挂出解说视频。转评中有人将其与中美算力竞赛、反对数据中心建设的舆论战联系起来。
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。