Daily Intel · 资讯

AI 资讯

每天一轮 AI 检索:GitHub 项目、开源产品、X 热议、报告观点——条条带源链接,死链不上桌。

NO.048 · 2026-09-12 出刊
2026.09.10 – 2026.09.12 · 14 370 条 · 每日 06:10 自动更新

NO.048

09.12

星期六

开源权重今天被直接拿来对账:Moonshot把规模化收入押在Kimi的API和订阅放量上,DeepSeek则放出552B的V4.1-Flash,用非对称激活去压KV cache和agent缓存成本。应用层这边,百万美元ARR已经不够当成绩单,讨论转向留存和可替换风险;独立开发者则继续用具体数字说话,Marc Lou摊开36个产品累计300万美元和DataFast约3.08万美元MRR,glasa用提前养好的名单换来首周1.3万美元。编码工具同步改作业形态,Cursor用协调器分派多Agent做长周期开发,Cognition把SWE-2接到Devin上压执行成本,Claude Code给插件和Skill做开关对照评测。

31 条 · AI 检索生成读今日日报 ↗
今天2026.09.12星期六
31

DeepSeek-V4.1-Flash 开源并上线 API,552B MoE、非对称激活引基建圈跟进

DeepSeek 发布 V4.1-Flash:552B 参数 MoE,采用 Causal Encoder-Decoder,输入约 8B、输出约 16B 激活,并强调更小 KV cache 与更低 agent 缓存成本。模型已上线 API(deepseek-flash),权重与技术报告放在 Hugging Face,SGLang 等推理栈在发布后持续报优化数字。

X 热议x.com

月之暗面 Kimi K2.8 Preview 全量上线 Kimi Code

K2.8 Preview 于 9 月 11 日接入 Kimi Code,Model ID 仍为 kimi-for-coding,客户端无需改配置。官方称综合表现接近 K3,支持 low/high/max 思考档位,全会员档位开放最高 1M 上下文。

产品发布kimi.com

面向真正递归自我改进的RSI路线图与挑战分析

论文提出Headroom-Closed Index衡量现有LLM的改进空间,并给出从执行自主到元改进的RSI路线图。作者结合科学发现、具身智能与软件工程等场景,梳理产业实践以及实现递归自我改进仍需面对的障碍。

报告观点arxiv.org

OpenClaw 发布 2026.9.4:统一插件工作台与可回滚更新

自托管 AI 助手网关新增 Control UI 插件发现与安装、失败更新安全回滚,以及从本地项目或 GitHub 仓库启动云会话快照。该版本还加入 GPT Image 2.5 与终端交互问答,并修复记忆与消息通道问题。

开源产品github.com389,456

合成数据可能损害技能检索:LLM Agent中的灾难性遗忘

研究在约3.4万技能库上发现,合成数据微调能提升分布内检索,但对真实与OOD技能会造成灾难性遗忘。结合EWC、LwF等持续学习方法,可在保留OOD表现的同时提升小规模Qwen检索器效果。

报告观点arxiv.org

从参数到答案:LLM如何检索并使用内部知识

研究通过对Qwen、Llama、Gemma隐藏状态做分层干预,分离查询路由与目标知识在答题过程中的作用。结果显示不同模型存在路由到内容的交接窗口,因果控制会随层数从路由转向已拟合内容。

报告观点arxiv.org

Nous Research 发布 Hermes Agent v0.21.2,修复 state.db 会话库

可自部署的 Hermes Agent 在 9 月 11 日推出补丁版,集中修复 v0.21.0 会话存储改写后出现的 state.db 锁冲突与误报损坏。发布说明同时汇总四天内 300 余个已合并改动,适合已在本机或 VPS 运行该桌面/网关 Agent 的开发者升级。

开源产品github.com244,586

Claude Code 上线 plugin eval,用对照实验衡量插件与 Skill 是否真的加分

Anthropic 开发者账号宣布 Claude Code 新增 claude plugin eval:可自建测试用例,分别在启用/关闭插件下跑分并输出终端结果与 HTML 报告。官方提醒评测会消耗 token,hook 与 MCP 以当前用户权限运行,建议先用 --runs 1 试跑。

X 热议x.com

独立开发者Marc Lou复盘36个产品累计300万美元收入,DataFast现报约3.08万美元MRR

Marc Lou在9月8日的一手通讯里写明,自己用36个创业项目累计做到300万美元收入,并给出DataFast当前30831美元MRR、约7%流失的数字。文中还回顾TrustMRR上线24小时曾做到2万美元/月广告位收入,随后靠加垂直功能把项目稳住。

商业变现newsletter.marclou.com

Anthropic评估前沿模型在情报定位与常规武器相关任务上的能力

Anthropic Frontier Red Team发布评估,测量模型在战术情报定位、照片地理定位以及模拟无人机制导软件编写等任务上的表现。报告同时对比开源权重模型,并讨论这些能力对误用风险与安全防护的影响。

报告观点anthropic.com

LobeHub v2.2.17 发布:强化目标规划与本地文件工作流

可 Docker/桌面自托管的 LobeHub 工作台加入更稳的 Goals 规划、验收流程与本地文件编辑、表格预览及 HTML Artifact 发布。版本同时接入 GPT-6 Astra、Qwen3.8 Max、Gemini 3.8 Flash 等模型,并含数据库迁移 0158–0161,升级前需备份。

开源产品github.com82,410

Cursor 上线 Projects:协调器分派多 Agent 做长周期开发

Cursor 推出 Projects 公测,由协调器规划任务并分派云端或本地子 Agent 写代码,共享项目上下文并可订阅 Slack、定时任务与 PR。官方称重度用户合并 PR 数量明显上升,适合功能开发与迁移类工作。

产品发布cursor.com

Kimi制造商Moonshot把开源权重模型做成可规模化收入

TechCrunch跟进称,Moonshot把8月约10亿美元年化收入再翻倍的目标,建立在Kimi K3上线后的API与订阅放量上。报道同时指出OpenRouter上K3相关模型仍有约3000亿token/日的生成量,但开源权重路径的毛利率低于闭源实验室。

商业变现techcrunch.com

OpenHands v1.18.0 发布:自托管编码 Agent 控制台更新自动化权限

OpenHands Agent Canvas 作为可自托管的开发者控制中心,1.18.0 允许在云后端编辑自动化、显示运行身份,并限制仅创建者可重新开启自动化。界面还支持点击附件图片全屏查看,适合在本地或私有集群调度编码 Agent。

开源产品github.com87,515

MindTopo:基础模型能否在拓扑空间中推理

MindTopo从连续性、分离、顺序、包围和纽结五类拓扑关系构建约1.1万条评测样本,分别考察推理与闭环规划。14个MLLM在规划上弱于推理,生成式观测也难以稳定保持拓扑约束。

报告观点arxiv.org

llmfit:一条命令判断本机硬件能跑哪些模型

扫描本机硬件后对照大量模型与供应商,给出可运行方案。对本地部署与选模型的开发者比较实用,仓库近两日仍在更新。

GitHub 项目github.com36,076

AI应用公司的100万美元ARR正在被重新定价:增长速度快,留存质量更关键

9月9日这篇分析援引a16z数据称,所研究AI公司中,企业向产品首年中位ARR已超过200万美元,消费向为420万美元。文中转述Lovable曾在不到两个月内从100万做到1000万美元ARR、Cognition约7个月从100万做到4000万美元ARR,并提醒要同时看收入质量和可替换风险。

商业变现whatastartup.substack.com

Artificial Id:为Agentic AI引入持续对齐的内部驱力

论文认为跨任务保持状态的Agent需要内部驱力来决定继续、停止或改向,而非完全依赖外部harness。最小实验显示适应性方向可从差异化持续性中涌现,同时也会让错配与损坏状态跨任务残留。

报告观点arxiv.org

Cline Desktop v0.0.26:独立桌面编码 Agent 显示当前分支 PR 状态

开源桌面应用 Cline Desktop 在编写区展示当前分支的 GitHub PR 编号、合并状态、改动行数与 CI 检查,并可跳转或创建对比页。Customize 中 Tools、Skills、Rules 列表交互统一,并修复队列删除与检查点恢复后会话卡在 Thinking 的问题。

开源产品github.com67,853

ChatGPT 官方放出 GPT-VI ASTRA 短片,开发者继续反馈用量与行为问题

ChatGPT 账号在 9 月 11 日发布标题为 GPT-VI ASTRA 的短视频,把这款已在圈内流传的模型重新推到时间线上。OpenAI 开发者关系与 Codex 相关账号同步提醒:觉得 Astra 行为不对就用 /feedback 提交完整线程,而不是只在评论区报 ID。

X 热议x.com

LoopX 1.0.3 发布:长周期 Agent 控制面增强委派与 Todo 事务

LoopX 是可本地运行的长周期 Agent 控制面,覆盖 Codex、Claude Code 等执行器上的目标、门禁与待办状态。1.0.3 强化飞书 Manager 委派、跨 Goal 结果汇报,并把晋升后的 Todo 规划写入单一 TypeScript 事务,同时扩大宿主支持。

开源产品github.com5,799

Cognition 发布编程模型 SWE-2 并接入 Devin

Cognition 于 9 月 10 日推出 SWE-2,并在 Devin Desktop/CLI 上线,付费档位可免费试用一个月。次日 Fusion 把 SWE-2 作为执行侧模型与 Fable 5.1 或 GPT-6 Astra 搭配,官方称可压低编码 Agent 成本。

产品发布cognition.com

TradingAgents:多智能体 LLM 金融交易框架

用多个 LLM Agent 分工做市场分析与交易决策的开源框架。近两日再次出现在 GitHub 热榜,适合研究多智能体协作与金融场景。

GitHub 项目github.com104,686

Claude 团队展示 Tag 值班流:告警进来后拉指标、对比发布并提议修复

ClaudeDevs 分享内部用 Claude Tag 做 on-call 的流程:Slack 告警触发后模型拉取指标、发布 diff 与 feature flag,给出可能根因和可批准合并的修复。这条演示把编码助手从写代码推到值班响应,和同期 plugin eval 一起强化 Claude Code 的工程向叙事。

X 热议x.com

glasa.io创始人贴出首周1.3万美元MRR:先养社群再收费

Cem Hasoglu在9月11日帖中称,@glasaio首周做到1.3万美元MRR,并写明增长并非来自上线当天,而是提前做了4000人名单和约1000人的Slack群。他在9月3日另一条帖子里补充过同期数据:38个付费用户、14个代运营客户、38场销售通话。

商业变现x.com

homestead-memory:用 hooks 做本地哈希链工具调用记录

通过 Claude Code 的 PreToolUse/PostToolUse 把每次工具调用写成可校验的本地哈希链表。另提供 MCP 记忆查询工具,适合审计代理实际执行路径。

GitHub 项目github.com1

Meta 将 Muse Spark 1.3 max 放到 Muse Code contributor 档

Meta 开发者账号确认 Muse Spark 1.3 的 max reasoning 版本已对 contributor 档开放,目前主要在 Muse Code 里使用。入口在 dev.meta.ai,公开标价从约 5 美元档起步。

X 热议x.com

ai-usagebar:用 Waybar 监控 Claude、GPT、GLM 额度

Rust 写的 Waybar 小组件,查看 Claude、GPT、GLM、OpenRouter 套餐与剩余额度。9 月 11 日出现在新上榜列表。

GitHub 项目github.com474

CloddsBot:可自托管的跨市场 AI 交易 Agent

基于 Claude 的开源交易 Agent,覆盖预测市场、CEX 与多条链,支持扫描机会、下单与风控。9 月 11 日登上 GitHub 热榜。

GitHub 项目github.com2,110

story-skills:按插件分发的长篇叙事 Agent Skills

仓库在 2026-09-10 前后更新,把故事圣经、人物、世界观和连续性检查做成 Claude Code / Codex 插件。配套 CLI 对设定做确定性校验,可作为复杂多文件 agent 工作流参考。

GitHub 项目github.com217

ChatGPT 桌面端给 Pet 加开新对话能力,同时推出占位更小的 Mini

ChatGPT 官方账号称桌面宠物现在可追踪离开桌面期间的对话,并直接从宠物发起新聊天。不喜欢宠物的用户可改用 Mini,在设置里切换,功能相同但占用屏幕更少。

X 热议x.com
昨天2026.09.11星期五
27

DeepSeek 发布 V4.1 Flash 并下调 API 价格

DeepSeek 于 9 月 10 日上线 552B MoE 模型 V4.1 Flash,原生多模态,API 调用名改为 deepseek-flash。闲时缓存命中输入 0.02 元/百万 token、输出 4 元;9 月 14 日起 deepseek-v4-pro 将路由至该模型并按 Flash 价计费。

产品发布deepseek.com

Anthropic 威胁报告点名中国实验室蒸馏 Claude

Anthropic 发布 9 月威胁情报报告,称过去八个月已阻断针对 Claude 的网络攻击、监控、武器辅助及生物误用等活动。报告将阿里巴巴、Moonshot、DeepSeek、智谱等列入所谓非法蒸馏案例,并称已向执法机构和其他实验室共享线索。

X 热议anthropic.com

Dify 发布 v1.17.1,自托管知识库 API 密钥可按数据集隔离

开源 LLM 应用平台 Dify 于 9 月 10 日发布 1.17.1,新增按知识库作用域的 Service API Key,并修复文档抽取导致内容被改写的问题。使用捆绑 Weaviate 的自托管实例需按指南分阶段升级,否则向量检索可能损坏。

开源产品github.com155,354

RAGFlow 发布 v0.27.2,重构 Agentic RAG 检索框架

开源 RAG 引擎 RAGFlow 于 9 月 10 日发布 v0.27.2,重构 Agentic RAG 检索链路并补充 Sitemap、WebDAV、自托管 PaddleOCR-VL 等数据源。版本同时新增知识编译限流、图谱节点计数以及 Hubris、llmman 模型供应商。

开源产品github.com90,462

JarvisGUI:跨设备GUI智能体动态任务组合评测基准

北航与百度团队提出JarvisGUI,把GUI任务建模为轻量类型系统下的输入输出变换,自动组合覆盖Android、Windows与Ubuntu的跨设备工作流。评测显示开源GUI智能体在状态迁移、跨平台上下文推理和长程依赖上仍明显落后于单设备表现。

报告观点arxiv.org

Qwen Code 连续发布 v0.23.2/v0.23.3,补齐远程启动与联网搜索

阿里开源编程智能体 Qwen Code 在 9 月 9–10 日连发 0.23.2 与 0.23.3,加入一键远程启动、分屏会话导航,并默认开启 ModelStudio 的 web_search。版本同时改进 Agent 失败落账、钉钉工具授权卡片以及 GPT-5/GPT-6 推理力度配置。

开源产品github.com27,755

TeamAI CLI:团队级 Skill/规则/MCP 同步工具

腾讯开源的团队 CLI,把 Skill、规则、MCP 与知识库放进 Git 仓库,同步到 Claude Code、Codex、Cursor、OpenCode 等。9 月 10 日进入热榜并持续提交。

GitHub 项目github.com3,736

OpenAI Agents API 进入公开测试,托管 Agent 循环与沙箱

OpenAI 推出 Agents API 公开测试,用 Codex harness 托管编排、长会话和上下文,开发者可自带或选用托管沙箱跑代码与文件。文档同时给出 e2b、Modal、Vercel 等集成路径,面向可落地的云端 Agent 工作流。

X 热议x.com

Pocket FM创始人称公司ARR达5亿美元,AI内容产能扩至每年250万小时

CEO Rohan Nayak于9月10日发帖称,Pocket FM从接近零做到5亿美元ARR,过去一年新增2.5亿美元且保持EBITDA盈利。团队将内容生产全面切到AI后,年产量从约2.5万小时升至250万小时,并用AI批量制作广告、做本地化而非简单翻译。

商业变现x.com

A-MLE:用智能体系统加速工业广告排序中的机器学习迭代

该论文把广告排序模型的假设提出、实验执行与结果分析拆成五阶段,由单一LLM智能体调用领域技能并在沙箱中跑通实验,关键节点保留人工确认。作者在大规模排序模型上部署该系统,并比较Claude、Gemini与GPT家族在执行稳定性与探索激进程度上的差异。

报告观点arxiv.org

ComfyUI 发布 v0.35.0,新增 WAN3-Prime 与 3D 网格节点

开源扩散工作流平台 ComfyUI 于 9 月 9 日发布 v0.35.0,接入 WAN3-Prime、Recraft V4 Styles、Google Omni 1.1,并新增 GLB/GLTF/OBJ/STL 转网格节点。版本同时支持 AVIF 保存、修正容器 cgroup 显存上限识别,并下线即将退役的 Veo 2/3.0 合作节点。

开源产品github.com132,391

22岁创始人Mauro披露健身应用Symmetry月入约16万美元

在Starter Story访谈中,Mauro称面向西语市场的健身房追踪应用Symmetry上线约一年后月收入约16万美元、下载约300万次。增长主要靠约8万条UGC视频和A/B测试,团队把近一半收入分给创作者。

商业变现youtube.com

OpenClaw 发布 2026.6.35 LTS,回移植通道安全与投递可靠性修复

可自托管个人 AI 助理 OpenClaw 于 9 月 10 日发布 2026.6.35,作为 6 月扩展稳定线的收官版本。该版本收紧供应商与频道边界、限制不可信响应体大小,并增强长任务取消、重试与部分发送的恢复能力。

开源产品github.com389,386

Cognition 发布编程模型 SWE-2 并接入 Devin

Cognition 发布 SWE-2,称在 FrontierCode 1.1 Main 上达到 50.0%,成本低于 Claude Fable 5.1。该模型基于 Kimi K3 做强化学习后训练,即日起可在 Devin Desktop 与 CLI 使用。

产品发布cognition.com

显化应用Stella创始人复述:上线约两个月MRR约34万美元

Starter Story近日再次放出Sarah Pearl访谈片段,她称用Claude Code和Google AI Studio做出Stella,上线约两个月后MRR约34万美元,付费用户约1.2万、下载超20万。获客依赖已有社交媒体账号和评论区引流,而不是先做产品再找流量。

商业变现youtube.com

TRACE:用仿真合成奖励训练因果探查推理智能体

TRACE通过向仿真器注入干预并生成可核验奖励,把难以直接标注的诊断推理任务纳入强化学习。在含12类根因的数字广告诊断环境中,经合成奖励训练的Qwen3.5-35B-A3B在归因指标上超过部分提示式前沿模型,同时调用更少工具。

报告观点arxiv.org

trailofbits/skills:安全审计向 Claude Code Skill 市场

Trail of Bits 的插件市场仓库,最近提交落在 2026-09-09,面向漏洞发现、差分审查与智能合约安全。可用 /plugin marketplace add 安装,也可通过 Skills Over MCP 把 SKILL.md 暴露成实时 MCP 工具。

GitHub 项目github.com7,033

ConvMem:用卷积式记忆做训练无关的长上下文推理

ConvMem把长文本推理改写成层次卷积,将LLM当作卷积核去汇总文本片段,并通过步长、跳跃连接与多核卷积降低误差累积。该方法无需训练即可并行处理长上下文,并在RULER相关多跳问答设置中超过对比基线。

报告观点arxiv.org

Chatbox 发布 v1.23.2,远程 MCP 支持 OAuth 授权

跨平台开源 AI 客户端 Chatbox 于 9 月 10 日发布 v1.23.2,为远程 MCP 服务增加 OAuth 授权、工具列表刷新,并支持自定义对话压缩提示词。版本同时补充 GPT-6 推理力度控制,以及 Kimi、OpenCode 等模型目录兼容。

开源产品github.com41,713

PI-Desktop:本地优先的编程 Agent 桌面端

Electron + Rust 宿主,叠加 pi Agent Harness 与可安装插件,支持自带模型、本地项目和长会话。9 月 10 日热榜出现,面向不想锁进单一 IDE 的开发者。

GitHub 项目github.com2,251

Epoch:GPT-6 Astra 长上下文延迟仍呈二次增长

Epoch AI 补充测量称,GPT-6 Astra 在长上下文上的首 token 延迟曲线与 GPT-5.6 类似,并对应超过约 272k 输入后涨价的计费结构。对比之下,Claude 5 系列延迟更接近线性,长文档场景选型时需要把延迟和价格一起看。

X 热议x.com

机器人公司Skild AI称部署启动10个月内ARR达到1亿美元

Skild AI官方账号9月10日宣布,公司在工厂、工地、厨房和数据中心等场景部署通用机器人智能,并在开始部署后10个月内达到1亿美元ARR。该案例把物理AI从演示推进到可计费的现场作业。

商业变现x.com

Cline Desktop 发布 v0.0.25,修正 Codex 模型清单与 Windows 升级锁文件

开源编程助手 Cline 桌面版于 9 月 10 日发布 v0.0.25,ChatGPT 订阅通道仅展示套餐可用的 Codex 模型,并修正 Windows 安装时 sidecar 占用导致的升级失败。版本还允许 Claude Code、Codex CLI 等本地 CLI 认证在无 API Key 时启动会话。

开源产品github.com67,799

OpenAI 暂停 200 美元 Pro 新订,称 Astra 算力吃紧

OpenAI 员工 Tibo 宣布暂停 $200 Pro 计划的新订阅,理由是 Astra 需求过大、该档对系统压力最高。现有账户、其他套餐和 API 不受影响,公司称正在扩容。

X 热议x.com

GameFactory-3A:游戏资产生成 Agent Skill 框架

用编码 Agent 从需求生成 3D、动作、音频与引擎适配代码,覆盖 UE5、Unity、Godot、Blender。9 月 10 日首次进入部分热榜快照。

GitHub 项目github.com624

黄仁勋回应研究员离职警告:称其安全判断不成立

围绕前 Anthropic 研究员 Jacob Coxon 辞职帖,黄仁勋称其关于灭绝风险的表述“deeply untrue”,并指其忽视业界已有安全工作。该表态在 X 上被大量转发,安全派与加速派继续就实验室节奏和监管展开争论。

X 热议x.com

Suno 发布与唱片公司合作训练的 v6 音乐模型

Suno 推出 v6、v6-wild 与免费版 v6-mini,训练数据包含 Warner Music、BMG、Believe 授权曲目。旧模型将随新版本上线逐步下线,并支持按歌词或片段局部改曲。

产品发布suno.com
2026.09.10星期四
28

vLLM v0.29.0 推理服务引擎发布

vLLM 于 2026-09-08/09 发布 v0.29.0,默认启用 Model Runner V2,并加入 Hy4-preview、Qwen3.8-Flash-Next 等模型支持。可作为独立推理服务在自有集群上部署,面向高吞吐 LLM serving。

开源产品github.com91,365

ExecCritic:让编码智能体先学会写测试再据此改代码

论文将测试生成与源码修复拆成独立角色,并用角色专用强化学习分别训练基于 Qwen-3.5-35B-A3B 的 Test 与 Repair 智能体。在 SWE-bench Verified 上,两个经后训练的 Qwen 智能体组合达到 72.6% 解决率,较无测试基线高出 11.4 个百分点。

报告观点arxiv.org

Anthropic预训练研究员Jacob Coxon辞职并公开批评两家实验室

曾在OpenAI与Anthropic做预训练的Jacob Coxon发帖称已辞职,指责两家公司正冲向可自我改进的超级智能。该长帖在圈内引发对齐、竞赛与是否该暂停能力提升的争论。

X 热议x.com

爱分析发布中国AI厂商Token收入榜:字节年化约300亿元

爱分析9月9日发布Token收入榜,字节年化ARR约300亿元,阿里约160亿元,智谱进入百亿档;第二档含DeepSeek、Kimi、MiniMax、可灵。对国内开发者判断模型厂商业化结构、API涨价与视频场景定价权有直接参考。

商业变现sohu.com

AgentIdeaBench:面向智能体时代的科学构想评测基准

该论文提出 AgentIdeaBench,在静态观察与主动探索两种设定下评测 33 个 LLM 的科学构想能力,覆盖五个学科的 40 个子领域。主动探索能暴露更大能力空间,收益主要落在可行性、清晰度与具体性,评测到的原创性则基本不变。

报告观点arxiv.org

独立开发者Marc Lou拍卖身体广告位,23小时实收2.9万美元

Marc Lou在X公开HYROX赛前肌肉广告位竞拍:23小时带来150万浏览、3.5万独立访客,账面毛收入6.3万美元、退还被超价后实收约2.9万美元。该玩法把个人注意力直接做成可竞价库存,适合有粉丝基础的开发者拆解。

商业变现x.com

LongHorizon-Harness:高德 AMAP 的长程 Computer-Use 闭环

给 Claude Code、Codex、OpenCode、DeepSeek Harness 套一层规划-执行-审计-检查点循环,用于跨桌面与终端的长任务。近期被 agent 热度图列入观察名单,带中文文档。

GitHub 项目github.com1,481

Procedural Graph:为 LLM 智能体构建可自演化的程序性执行结构

作者将程序性知识组织为(过程,关系,过程)三元组,在每一步用局部子图生成情境引导,而不直接指定动作。图结构可由失败与成功轨迹对比后自动改写,在多种任务与模型上相对基于记忆的基线带来稳定提升。

报告观点arxiv.org

Goose v1.50.0 本地 AI Agent 发布

Block 开源的 Goose 于 2026-09-08 发布 v1.50.0,提供桌面端与 CLI,可在本机对接 GPT-6 Astra,并增强 goose-agent 工具调用与 AIML API。开发者可直接下载安装包或 CLI 在本地自部署运行。

开源产品github.com54,066

Meta上线个人智能体Muse,可跨应用执行邮件购物差旅

Meta推出个人智能体Muse,由Muse Spark 1.3驱动,覆盖iOS、Android、Web与WhatsApp,可在后台处理邮件、购物和行程。讨论焦点集中在对邮箱、支付与云端数据的授权范围以及内测中的安全问题。

X 热议x.com

Cline Desktop v0.0.24 桌面编程 Agent 发布

Cline 于 2026-09-09 发布 Desktop v0.0.24,修复直播流重复渲染、排队消息丢失,并在模型循环卡住时给出继续或停止选项。该桌面应用可在本地文件夹中运行编程 Agent、调度任务并管理 MCP。

开源产品github.com67,742

DeepMind发布AlphaGenome Atlas,覆盖约90亿种单碱基变异预测

Google DeepMind推出可检索的AlphaGenome Atlas,对人类基因组约90亿种单字母DNA变化给出分子效应预测,并提供AVI影响分数。资源可通过网站、API和后续云服务向科研使用开放。

X 热议x.com

不可靠的进度条:LLM 智能体能在任务全程如实汇报进度吗

作者在 τ²-bench 与自建 StageIF 上评估模型在任务各阶段报告进度的可靠性,发现几乎所有受测模型都在部分阶段可靠、在另一些阶段失真。多数模型在任务进行中准确率下降、结束后回升,因此框架不宜仅凭模型自报状态来控制任务流。

报告观点arxiv.org

Ruflo:多后端 Agent 元 Harness 近两日回温

在 Claude Code、Codex、Hermes 等宿主上叠加多 Agent 集群、自适应记忆与 RAG。约7.2万星,9月8日至9日连续出现在 Trending,周增速再次走高。

GitHub 项目github.com71,806

openai/skills:Codex 官方 Skills 目录热度回升

OpenAI 公开的 Codex Skill 目录,用文件夹封装指令、脚本与资源,便于按任务复用能力。9月8日至9日连续出现在 GitHub Trending。

GitHub 项目github.com26,763

上半年中国AI创企融资额突破3000亿元,上亿元交易77起

智东西据公开信息统计,2026年上半年中国AI产业链上亿元融资77起、合计约1262亿元,IT桔子口径下创企总融资额突破3000亿元;DeepSeek上半年累计融资约500亿元居前。资金仍集中在视频生成、Agent与模型层。

商业变现36kr.com

code-graph-mcp 0.76:给 Claude Code 的 AST 知识图谱 MCP

该 MCP 用 Tree-sitter 索引本地代码,提供语义搜索、调用图与影响分析,并带 Claude Code plugin、skills 与自动索引 hooks。变更日志在 2026-09-07/08 发布 0.76 系列,调整了调用图歧义边的默认披露。

GitHub 项目github.com75

i-have-adhd:让编码 Agent 先给结论的输出技能

面向 Claude Code、Codex、Gemini 等编码 Agent 的技能包,约束回复先给可执行结论并减少铺垫。9月8日至9日登上 GitHub Trending,仓库约3.4万星。

GitHub 项目github.com34,363

Suno与华纳、BMG达成曲库分成合作,AI音乐进入授权变现

9月9日Suno宣布与Warner Music、BMG合作,艺人可选择把曲库开放给用户做生成实验并按分成获得收入,同时上线V6模型。这把AI音乐从灰色训练争议推进到可拆解的授权与版权分成模式。

商业变现tennessean.com

Silent Revision:量化前沿 AI 开发者安全框架中的未披露修订

研究追踪 12 家已发布安全框架的开发者共 710 条承诺实例,约 67% 的实质性变更在开发者公开说明中未被点名。约 77% 的变更是弱化或删除承诺,作者主张公开义务应附带逐条枚举变更内容。

报告观点arxiv.org

Agent Teams AI v2.14.1 多 Agent 协作产品发布

Agent Teams AI 于 2026-09-08 发布 v2.14.1,修复 Cursor、GLM(Z.AI)与 SuperGrok 现有集成的启动与恢复,并支持单独重试失败的 OpenCode 队友。提供 deb/rpm 等安装包,可在本机部署多 Agent 团队。

开源产品github.com2,094

easy-skills:团队 Skills 安装与软链分发 CLI

npm 包 easy-skills 于 2026-09-08 发布,把技能统一装到 ~/.agents/skills/,再用 --claude 软链到 Claude Code,支持从 GitHub 仓库或注册表安装。面向团队维护一份技能库、多编辑器复用的场景。

GitHub 项目github.com1

HyperFrames:给 Agent 用的 HTML 渲染视频框架

HeyGen 开源的确定性 HTML 到 MP4 渲染工具,提供 CLI 与 Agent Skill,便于生成演示视频和构图。9月9日仍在高频提交,近两日持续出现在 Trending。

GitHub 项目github.com48,377

民调显示Sanders暂停先进AI并禁止超级智能的法案获跨党派支持

Bernie Sanders转发Data for Progress民调称,其与众议员Casar提出的暂停AI开发、永久禁止制造超级智能的法案获得约68%选民支持。Kalshi等账号同步跟进立法进展,政策讨论升温。

X 热议x.com

法国创作者向老客户预售SaaS,当天做到500欧元MRR

Kevin Dumont在X称产品尚未公开发布,只向部分老客户宣布并开始私域推销,当天傍晚MRR已到500欧元,并立下9月30日冲击1万欧元MRR的公开目标。路径是先卖给已有信任关系的人,而不是先做流量。

商业变现x.com

LoopX v1.0.2 长程 Agent 控制面发布

LoopX 于 2026-09-09 发布 1.0.2,统一 Todo 生命周期权责、自动恢复缺失展示,并降低大工作区历史扫描开销。它是可本地安装的控制面,用来编排 Codex、Claude Code、Cursor 等 harness 的长任务。

开源产品github.com5,758

圈内用MODEL FATIGUE形容同一周多家实验室连续发模型

TestingCatalog等账号盘点Anthropic、Meta、Google、OpenAI近期密集发版,以及研究员离职与未发布模型科研声称。开发者吐槽评估跟不上发布节奏,开始筛选而非全量对标新模型。

X 热议x.com

Agent Swarm v1.143.0 自托管 Agent 集群发布

desplega-ai/agent-swarm 于 2026-09-09 发布 v1.143.0,可用 npm/bun 或 Docker 拉起 Server 与 Worker。该版本含 UI 日志与上下文用量展示修复,以及 Claude Code 镜像例行更新。

开源产品github.com758

内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。

AI 资讯 | 资讯狗 | Zixungou