09.12
2026-09-12 · 星期六 · 06:19 截稿 · 覆盖近 1-3 天动态
开源权重今天被直接拿来对账:Moonshot把规模化收入押在Kimi的API和订阅放量上,DeepSeek则放出552B的V4.1-Flash,用非对称激活去压KV cache和agent缓存成本。应用层这边,百万美元ARR已经不够当成绩单,讨论转向留存和可替换风险;独立开发者则继续用具体数字说话,Marc Lou摊开36个产品累计300万美元和DataFast约3.08万美元MRR,glasa用提前养好的名单换来首周1.3万美元。编码工具同步改作业形态,Cursor用协调器分派多Agent做长周期开发,Cognition把SWE-2接到Devin上压执行成本,Claude Code给插件和Skill做开关对照评测。
商业变现
4 条
独立开发者Marc Lou复盘36个产品累计300万美元收入,DataFast现报约3.08万美元MRR
Marc Lou在9月8日的一手通讯里写明,自己用36个创业项目累计做到300万美元收入,并给出DataFast当前30831美元MRR、约7%流失的数字。文中还回顾TrustMRR上线24小时曾做到2万美元/月广告位收入,随后靠加垂直功能把项目稳住。
Kimi制造商Moonshot把开源权重模型做成可规模化收入
TechCrunch跟进称,Moonshot把8月约10亿美元年化收入再翻倍的目标,建立在Kimi K3上线后的API与订阅放量上。报道同时指出OpenRouter上K3相关模型仍有约3000亿token/日的生成量,但开源权重路径的毛利率低于闭源实验室。
AI应用公司的100万美元ARR正在被重新定价:增长速度快,留存质量更关键
9月9日这篇分析援引a16z数据称,所研究AI公司中,企业向产品首年中位ARR已超过200万美元,消费向为420万美元。文中转述Lovable曾在不到两个月内从100万做到1000万美元ARR、Cognition约7个月从100万做到4000万美元ARR,并提醒要同时看收入质量和可替换风险。
glasa.io创始人贴出首周1.3万美元MRR:先养社群再收费
Cem Hasoglu在9月11日帖中称,@glasaio首周做到1.3万美元MRR,并写明增长并非来自上线当天,而是提前做了4000人名单和约1000人的Slack群。他在9月3日另一条帖子里补充过同期数据:38个付费用户、14个代运营客户、38场销售通话。
产品发布
3 条
月之暗面 Kimi K2.8 Preview 全量上线 Kimi Code
K2.8 Preview 于 9 月 11 日接入 Kimi Code,Model ID 仍为 kimi-for-coding,客户端无需改配置。官方称综合表现接近 K3,支持 low/high/max 思考档位,全会员档位开放最高 1M 上下文。
Cursor 上线 Projects:协调器分派多 Agent 做长周期开发
Cursor 推出 Projects 公测,由协调器规划任务并分派云端或本地子 Agent 写代码,共享项目上下文并可订阅 Slack、定时任务与 PR。官方称重度用户合并 PR 数量明显上升,适合功能开发与迁移类工作。
Cognition 发布编程模型 SWE-2 并接入 Devin
Cognition 于 9 月 10 日推出 SWE-2,并在 Devin Desktop/CLI 上线,付费档位可免费试用一个月。次日 Fusion 把 SWE-2 作为执行侧模型与 Fable 5.1 或 GPT-6 Astra 搭配,官方称可压低编码 Agent 成本。
X 热议
6 条
DeepSeek-V4.1-Flash 开源并上线 API,552B MoE、非对称激活引基建圈跟进
DeepSeek 发布 V4.1-Flash:552B 参数 MoE,采用 Causal Encoder-Decoder,输入约 8B、输出约 16B 激活,并强调更小 KV cache 与更低 agent 缓存成本。模型已上线 API(deepseek-flash),权重与技术报告放在 Hugging Face,SGLang 等推理栈在发布后持续报优化数字。
Claude Code 上线 plugin eval,用对照实验衡量插件与 Skill 是否真的加分
Anthropic 开发者账号宣布 Claude Code 新增 claude plugin eval:可自建测试用例,分别在启用/关闭插件下跑分并输出终端结果与 HTML 报告。官方提醒评测会消耗 token,hook 与 MCP 以当前用户权限运行,建议先用 --runs 1 试跑。
ChatGPT 官方放出 GPT-VI ASTRA 短片,开发者继续反馈用量与行为问题
ChatGPT 账号在 9 月 11 日发布标题为 GPT-VI ASTRA 的短视频,把这款已在圈内流传的模型重新推到时间线上。OpenAI 开发者关系与 Codex 相关账号同步提醒:觉得 Astra 行为不对就用 /feedback 提交完整线程,而不是只在评论区报 ID。
Claude 团队展示 Tag 值班流:告警进来后拉指标、对比发布并提议修复
ClaudeDevs 分享内部用 Claude Tag 做 on-call 的流程:Slack 告警触发后模型拉取指标、发布 diff 与 feature flag,给出可能根因和可批准合并的修复。这条演示把编码助手从写代码推到值班响应,和同期 plugin eval 一起强化 Claude Code 的工程向叙事。
Meta 将 Muse Spark 1.3 max 放到 Muse Code contributor 档
Meta 开发者账号确认 Muse Spark 1.3 的 max reasoning 版本已对 contributor 档开放,目前主要在 Muse Code 里使用。入口在 dev.meta.ai,公开标价从约 5 美元档起步。
ChatGPT 桌面端给 Pet 加开新对话能力,同时推出占位更小的 Mini
ChatGPT 官方账号称桌面宠物现在可追踪离开桌面期间的对话,并直接从宠物发起新聊天。不喜欢宠物的用户可改用 Mini,在设置里切换,功能相同但占用屏幕更少。
GitHub 项目
6 条
llmfit:一条命令判断本机硬件能跑哪些模型
扫描本机硬件后对照大量模型与供应商,给出可运行方案。对本地部署与选模型的开发者比较实用,仓库近两日仍在更新。
TradingAgents:多智能体 LLM 金融交易框架
用多个 LLM Agent 分工做市场分析与交易决策的开源框架。近两日再次出现在 GitHub 热榜,适合研究多智能体协作与金融场景。
homestead-memory:用 hooks 做本地哈希链工具调用记录
通过 Claude Code 的 PreToolUse/PostToolUse 把每次工具调用写成可校验的本地哈希链表。另提供 MCP 记忆查询工具,适合审计代理实际执行路径。
ai-usagebar:用 Waybar 监控 Claude、GPT、GLM 额度
Rust 写的 Waybar 小组件,查看 Claude、GPT、GLM、OpenRouter 套餐与剩余额度。9 月 11 日出现在新上榜列表。
CloddsBot:可自托管的跨市场 AI 交易 Agent
基于 Claude 的开源交易 Agent,覆盖预测市场、CEX 与多条链,支持扫描机会、下单与风控。9 月 11 日登上 GitHub 热榜。
story-skills:按插件分发的长篇叙事 Agent Skills
仓库在 2026-09-10 前后更新,把故事圣经、人物、世界观和连续性检查做成 Claude Code / Codex 插件。配套 CLI 对设定做确定性校验,可作为复杂多文件 agent 工作流参考。
开源产品
6 条
OpenClaw 发布 2026.9.4:统一插件工作台与可回滚更新
自托管 AI 助手网关新增 Control UI 插件发现与安装、失败更新安全回滚,以及从本地项目或 GitHub 仓库启动云会话快照。该版本还加入 GPT Image 2.5 与终端交互问答,并修复记忆与消息通道问题。
Nous Research 发布 Hermes Agent v0.21.2,修复 state.db 会话库
可自部署的 Hermes Agent 在 9 月 11 日推出补丁版,集中修复 v0.21.0 会话存储改写后出现的 state.db 锁冲突与误报损坏。发布说明同时汇总四天内 300 余个已合并改动,适合已在本机或 VPS 运行该桌面/网关 Agent 的开发者升级。
LobeHub v2.2.17 发布:强化目标规划与本地文件工作流
可 Docker/桌面自托管的 LobeHub 工作台加入更稳的 Goals 规划、验收流程与本地文件编辑、表格预览及 HTML Artifact 发布。版本同时接入 GPT-6 Astra、Qwen3.8 Max、Gemini 3.8 Flash 等模型,并含数据库迁移 0158–0161,升级前需备份。
OpenHands v1.18.0 发布:自托管编码 Agent 控制台更新自动化权限
OpenHands Agent Canvas 作为可自托管的开发者控制中心,1.18.0 允许在云后端编辑自动化、显示运行身份,并限制仅创建者可重新开启自动化。界面还支持点击附件图片全屏查看,适合在本地或私有集群调度编码 Agent。
Cline Desktop v0.0.26:独立桌面编码 Agent 显示当前分支 PR 状态
开源桌面应用 Cline Desktop 在编写区展示当前分支的 GitHub PR 编号、合并状态、改动行数与 CI 检查,并可跳转或创建对比页。Customize 中 Tools、Skills、Rules 列表交互统一,并修复队列删除与检查点恢复后会话卡在 Thinking 的问题。
LoopX 1.0.3 发布:长周期 Agent 控制面增强委派与 Todo 事务
LoopX 是可本地运行的长周期 Agent 控制面,覆盖 Codex、Claude Code 等执行器上的目标、门禁与待办状态。1.0.3 强化飞书 Manager 委派、跨 Goal 结果汇报,并把晋升后的 Todo 规划写入单一 TypeScript 事务,同时扩大宿主支持。
报告观点
6 条
面向真正递归自我改进的RSI路线图与挑战分析
论文提出Headroom-Closed Index衡量现有LLM的改进空间,并给出从执行自主到元改进的RSI路线图。作者结合科学发现、具身智能与软件工程等场景,梳理产业实践以及实现递归自我改进仍需面对的障碍。
合成数据可能损害技能检索:LLM Agent中的灾难性遗忘
研究在约3.4万技能库上发现,合成数据微调能提升分布内检索,但对真实与OOD技能会造成灾难性遗忘。结合EWC、LwF等持续学习方法,可在保留OOD表现的同时提升小规模Qwen检索器效果。
从参数到答案:LLM如何检索并使用内部知识
研究通过对Qwen、Llama、Gemma隐藏状态做分层干预,分离查询路由与目标知识在答题过程中的作用。结果显示不同模型存在路由到内容的交接窗口,因果控制会随层数从路由转向已拟合内容。
Anthropic评估前沿模型在情报定位与常规武器相关任务上的能力
Anthropic Frontier Red Team发布评估,测量模型在战术情报定位、照片地理定位以及模拟无人机制导软件编写等任务上的表现。报告同时对比开源权重模型,并讨论这些能力对误用风险与安全防护的影响。
MindTopo:基础模型能否在拓扑空间中推理
MindTopo从连续性、分离、顺序、包围和纽结五类拓扑关系构建约1.1万条评测样本,分别考察推理与闭环规划。14个MLLM在规划上弱于推理,生成式观测也难以稳定保持拓扑约束。
Artificial Id:为Agentic AI引入持续对齐的内部驱力
论文认为跨任务保持状态的Agent需要内部驱力来决定继续、停止或改向,而非完全依赖外部harness。最小实验显示适应性方向可从差异化持续性中涌现,同时也会让错配与损坏状态跨任务残留。
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。