09.02
2026-09-02 · 星期三 · 06:19 截稿 · 覆盖近 1-3 天动态
今天两条账本比新模型发布更说明问题:独立开发者把外链拆成单独订阅,没靠传播就做到超过一万美元月经常性收入;另一家一人AI代理机构公开约八万美元MRR,推理加基础设施大约一千四百美元。Salesforce同时报出Agentforce约十五亿美元年经常性收入,但这更像大客户把AI写进合同,和前面那种按任务路由模型、按结果收钱的小作坊不是同一套生意。技能包正在变成可安装的工作流单元,从Postgres文档检索、Issue闭环研发到跨Claude Code与Codex续跑都有现成包,NVIDIA也放出安装前的静态扫描,第三方Skill的供应链风险已经从口头提醒变成可打分的检查项。消费级一侧,一份YAML就能在约4GB显卡上微调8B,混元把Hy4预览权重压到约214GB,Gemini给长视频按需抽帧并把token用量砍掉大约九成,能力继续从堆规模转向被更便宜地编排。
商业变现
3 条
Outrank拆出纯外链订阅,上线即录得超1万美元MRR
独立开发者Tibo把Outrank的外链投放拆成独立订阅,面向已有内容、只需外链来提升AI引用的用户。他称这条产品线尚未靠传播爆量就新增超过1万美元月经常性收入。
一人AI代理机构公开约8万美元MRR与模型路由成本结构
@DeRonin_称其独立运营的AI代理机构约8万美元月经常性收入,整套推理加基础设施约1400美元/月。他按任务把调研、起草、校验分给不同模型,并用另一家模型做交叉检查。
Salesforce披露Agentforce年经常性收入约15亿美元
报道称Salesforce的Agentforce ARR约15亿美元、Agentforce与数据相关ARR约39亿美元,同比增幅超过200%。公司同时推动按结果计费,并称超1万客户已使用至少一款AI产品。
产品发布
5 条
腾讯混元推出Hy4 preview轻量版
腾讯混元9月1日将Hy4 preview权重从约1.5TB压至约214GB,并放出GGUF量化包。压缩后长文理解与多轮检索接近原版,可在llama.cpp、vLLM等框架及异构设备上部署。
Anthropic发布Claude Fable 5.1与Mythos 5.1
Anthropic于9月1日上线Fable 5.1,输入输出价仍为每百万token 10/50美元,缓存读取降至原先约四分之一,并放宽部分安全拦截。Mythos 5.1面向受信项目开放,面向编码与长程知识工作。
Meta上线Muse Voice Transcribe实时转写模型
Meta Superintelligence Labs于9月1日发布实时语音感知模型Muse Voice Transcribe,支持流式ASR、20人以上说话人分离与多语代码切换。开发者可通过Meta Model API调用,定价约每千音频分钟3美元。
Inception推出扩散推理模型Mercury 2.5 Preview
Inception于8月31日上线Mercury 2.5 Preview,以并行扩散生成替代逐token解码,宣称在常规GPU上可达约1107 token/秒。OpenRouter标价约0.04/0.15美元每百万token,并提供限时折扣至9月8日。
Runway发布界面世界模型Solaris
Runway于8月31日公布Solaris,基于Gen-4.5按帧实时生成可交互界面,无需预写应用代码。目前以研究预览与早期访问形式推出,面向无代码交互界面实验。
X 热议
3 条
Gemini 上线 Agentic Video Understanding,长视频 token 用量下降
Google 为 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 加入按需检索帧、音频和转写的视频理解。官方称 token 消耗可降约 88%,分析成本可降约 66%,已通过 Gemini API 开放。
World Labs 发布 Atlas 世界模型,支持像素级相机控制与三维重建
Fei-Fei Li 团队推出多模态世界模型 Atlas,可从少量图像或视频生成、重建并模拟三维场景,支持精确相机轨迹。团队表示数周内开放早期访问,并展示机器人仿真用途。
OpenAI 研究员详解 Astra 的 ExploitBench 与内部新漏洞评测
OpenAI 安全方向研究员说明:因原基准可能污染,团队用 6–8 月新披露漏洞重测,Astra 仍大幅领先 GPT-5.6 Sol 且 token 更少。该结果是判定其跨过 cyber-critical 阈值的依据之一。
GitHub 项目
8 条
Timescale pg-aiguide:Postgres 文档检索 MCP 与 Claude 插件技能包
提供面向 Postgres/TimescaleDB 的 MCP 文档检索服务,以及可装入 Claude Code 的 schema、索引与性能相关 SKILL。适合让编码 Agent 按现行 Postgres 实践生成 SQL 与迁移。
Soup:一份 YAML 在 4GB 显卡上微调 8B
用单份 YAML 配置完成 SFT/DPO 等后训练,通过 layer streaming 降低显存占用,可在约 4GB 笔记本 GPU 上微调 8B 模型。对消费级显卡做小规模对齐实验比较友好。
NVIDIA SkillSpector:扫描 Agent Skill 安全风险
在安装前静态分析 Claude Code、Codex、MCP 技能包,检测提示注入、数据外泄与供应链类风险并给出评分报告。技能生态扩张后,这类检查对团队引入第三方 Skill 有参考价值。
VoiceStudio:本地语音克隆与配音工作室
本地运行的语音克隆、音色设计、视频配音、转写与有声书工具,支持多引擎与 OpenAI 兼容音频 API。可接入 MCP,适合不想把音频数据送上云的开发者。
video-use:用编码 Agent 剪视频
把原始素材丢进目录后,通过对话让编码 Agent 完成去口头禅、调色、字幕与叠加动画,并输出 final.mp4。来自 browser-use 团队,把视频后期做成可脚本化的 Agent 任务。
academic-research-skills:论文调研到修订技能包
覆盖检索、撰写、审稿与修订的 Claude Code 技能流,强调引用核验与人工把关,而不是一键代写整篇论文。对需要用 Agent 辅助文献与稿件流程的研发与高校用户更实用。
stele:跨 Claude Code 与 Codex 的任务状态续跑技能
用明文 write-ahead 任务状态保存进度,额度打满或会话中断后可换到另一套 harness 冷启动续做。面向多 Agent 切换与限流场景的工作流技能。
idd-skill:基于 GitHub Issue 的闭环 Agent 研发工作流
把认领 Issue、开分支、提 PR、跟评审与 CI、按策略合并写成仓库内可审计的 Markdown 技能。适合把 Claude Code 接到 Issue-driven 循环,而不是一次性聊天改代码。
开源产品
4 条
OpenClaw 2.0 发布:重构安装与浏览器端,新增共享云端会话
开源个人智能体 OpenClaw 于 8 月 31 日推出 2.0(v2026.8.1),由 933 名贡献者合入逾 1.6 万个 PR,简化安装、重建浏览器应用并加强安全边界。新版本可自动发现本机已有的 API 密钥与本地模型,并支持团队共享云端会话。
Chatbox v1.23.0 发布:持久记忆与混元、MiMo、GLM 接入
可自部署的桌面与移动端 AI 客户端 Chatbox 于 9 月 1 日发布 v1.23.0,新增全局或按搭档配置的持久记忆,以及工作模式 Soul 设定。该版本接入腾讯混元、小米 MiMo、LongCat、智谱 GLM Coding Plan,并支持自托管 SearXNG。
LiteLLM v1.99.0 发布:网关管理台暗色模式与批处理计费
开源 LLM 网关 LiteLLM 于 9 月 1 日发布 v1.99.0,管理后台完成 React 19 迁移并加入明暗主题,CLI 登录改为 OAuth+PKCE。该版本补齐批处理全链路计费,并允许在配置中声明预留吞吐与可插拔复杂度路由。
LMDeploy v0.17.0 发布:接入 DeepEPv2 并支持 Kimi K2.6
上海人工智能实验室开源推理服务 LMDeploy 于 9 月 1 日发布 v0.17.0,集成 DeepEPv2,并在 PyTorch 引擎中支持 Kimi K2.6。该版本优化 GLM-5.2 服务与 paged attention,KV 连接器可对接 Mooncake Store,可用 Docker 直接部署。
报告观点
6 条
Qwen3.8-Next 架构设计:评测、效率与训练稳定性
论文给出 Qwen3.8-Flash-Next 的架构与消融:125B 总参、每 token 激活 6B 的稀疏 MoE,并配合层间混合 Gated DeltaNet/全局注意力、Qwen Sparse Attention 与 Gated Residual。在约三分之一激活参数与训练 token、约九分之一训练 FLOPs 下,多数预训练基准可接近或超过前代 397B-A17B 模型,并讨论 Muon 优化器对学习率、批大小与训练稳定性的影响。
在人类监督减弱后扩展大推理模型:通向持续自我学习的路径
论文把大推理模型的继续提升拆成奖励轴与经验轴,并用 L0–L4 五级梯子标出人类仍需把控的环节。分析覆盖可验证奖励、可复用验证器、自生成课程与环境共进化,同时讨论奖励黑客、反馈漂移与课程坍缩等风险及对应评估对象。
PaperGym:用论文结构构造研究计划生成的训练环境
浙江大学等团队提出 PaperGym,把论文拆成“问题来自目标与背景、评分标准来自方法与实验”的训练环境,以降低 rubric 泄露。先用评分标准做自教师再做 GRPO,在 Qwen3-1.7B/4B/8B 上相对监督微调有稳定提升,并发布 PaperGym-20k 与两项评测集。
A.X K2 技术报告:面向智能体应用的 688B MoE 基础模型
SK Telecom 发布从零训练的 A.X K2,总参 688B、激活约 33B,预训练约 8.5T token,并引入 Sparse Gated Attention 与 Gated Norm 以支持长上下文与低比特部署。报告给出 Think-Fusion 统一思考/非思考模式,并在数学、韩语与工具使用等基准上与多款开源权重模型对照。
Aspire:模型能否从模糊目标出发完成自我进化
Aspire 只给出自然语言能力目标,隐藏下游评测任务,要求智能体自行解释目标、选数据、选更新方式并决定何时评估。基准同时覆盖权重进化与 harness 进化,用 520 条隐藏题目检验模糊目标如何把搜索压力转向目标解释而非给定指标优化。
面向 Agentic Skills 的系统基础:架构、生命周期与安全
论文把 skill 形式化为连接高层规划与确定性执行的外部化程序知识,并给出发现、编写、存储、检索、编排、执行修复、持续适应、评估与安全治理九阶段生命周期。目标是为可扩展、可验证的语言智能体提供统一系统参考架构,而非只讨论单条技能写法。
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。