AI 资讯日报 · Daily Digest

09.02

2026-09-02 · 星期三 · 06:19 截稿 · 覆盖近 1-3 天动态

NO.038
29 条 · 6 个分类
AI 检索生成

今天两条账本比新模型发布更说明问题:独立开发者把外链拆成单独订阅,没靠传播就做到超过一万美元月经常性收入;另一家一人AI代理机构公开约八万美元MRR,推理加基础设施大约一千四百美元。Salesforce同时报出Agentforce约十五亿美元年经常性收入,但这更像大客户把AI写进合同,和前面那种按任务路由模型、按结果收钱的小作坊不是同一套生意。技能包正在变成可安装的工作流单元,从Postgres文档检索、Issue闭环研发到跨Claude Code与Codex续跑都有现成包,NVIDIA也放出安装前的静态扫描,第三方Skill的供应链风险已经从口头提醒变成可打分的检查项。消费级一侧,一份YAML就能在约4GB显卡上微调8B,混元把Hy4预览权重压到约214GB,Gemini给长视频按需抽帧并把token用量砍掉大约九成,能力继续从堆规模转向被更便宜地编排。

01

商业变现


3
02

产品发布


5
03

X 热议


3
04

GitHub 项目


8

Timescale pg-aiguide:Postgres 文档检索 MCP 与 Claude 插件技能包

提供面向 Postgres/TimescaleDB 的 MCP 文档检索服务,以及可装入 Claude Code 的 schema、索引与性能相关 SKILL。适合让编码 Agent 按现行 Postgres 实践生成 SQL 与迁移。

github.com1,830

Soup:一份 YAML 在 4GB 显卡上微调 8B

用单份 YAML 配置完成 SFT/DPO 等后训练,通过 layer streaming 降低显存占用,可在约 4GB 笔记本 GPU 上微调 8B 模型。对消费级显卡做小规模对齐实验比较友好。

github.com4,543

NVIDIA SkillSpector:扫描 Agent Skill 安全风险

在安装前静态分析 Claude Code、Codex、MCP 技能包,检测提示注入、数据外泄与供应链类风险并给出评分报告。技能生态扩张后,这类检查对团队引入第三方 Skill 有参考价值。

github.com15,542

VoiceStudio:本地语音克隆与配音工作室

本地运行的语音克隆、音色设计、视频配音、转写与有声书工具,支持多引擎与 OpenAI 兼容音频 API。可接入 MCP,适合不想把音频数据送上云的开发者。

github.com13,770

video-use:用编码 Agent 剪视频

把原始素材丢进目录后,通过对话让编码 Agent 完成去口头禅、调色、字幕与叠加动画,并输出 final.mp4。来自 browser-use 团队,把视频后期做成可脚本化的 Agent 任务。

github.com22,877

academic-research-skills:论文调研到修订技能包

覆盖检索、撰写、审稿与修订的 Claude Code 技能流,强调引用核验与人工把关,而不是一键代写整篇论文。对需要用 Agent 辅助文献与稿件流程的研发与高校用户更实用。

github.com44,836

stele:跨 Claude Code 与 Codex 的任务状态续跑技能

用明文 write-ahead 任务状态保存进度,额度打满或会话中断后可换到另一套 harness 冷启动续做。面向多 Agent 切换与限流场景的工作流技能。

github.com1

idd-skill:基于 GitHub Issue 的闭环 Agent 研发工作流

把认领 Issue、开分支、提 PR、跟评审与 CI、按策略合并写成仓库内可审计的 Markdown 技能。适合把 Claude Code 接到 Issue-driven 循环,而不是一次性聊天改代码。

github.com11
05

开源产品


4
06

报告观点


6

Qwen3.8-Next 架构设计:评测、效率与训练稳定性

论文给出 Qwen3.8-Flash-Next 的架构与消融:125B 总参、每 token 激活 6B 的稀疏 MoE,并配合层间混合 Gated DeltaNet/全局注意力、Qwen Sparse Attention 与 Gated Residual。在约三分之一激活参数与训练 token、约九分之一训练 FLOPs 下,多数预训练基准可接近或超过前代 397B-A17B 模型,并讨论 Muon 优化器对学习率、批大小与训练稳定性的影响。

arxiv.org

在人类监督减弱后扩展大推理模型:通向持续自我学习的路径

论文把大推理模型的继续提升拆成奖励轴与经验轴,并用 L0–L4 五级梯子标出人类仍需把控的环节。分析覆盖可验证奖励、可复用验证器、自生成课程与环境共进化,同时讨论奖励黑客、反馈漂移与课程坍缩等风险及对应评估对象。

arxiv.org

PaperGym:用论文结构构造研究计划生成的训练环境

浙江大学等团队提出 PaperGym,把论文拆成“问题来自目标与背景、评分标准来自方法与实验”的训练环境,以降低 rubric 泄露。先用评分标准做自教师再做 GRPO,在 Qwen3-1.7B/4B/8B 上相对监督微调有稳定提升,并发布 PaperGym-20k 与两项评测集。

arxiv.org

A.X K2 技术报告:面向智能体应用的 688B MoE 基础模型

SK Telecom 发布从零训练的 A.X K2,总参 688B、激活约 33B,预训练约 8.5T token,并引入 Sparse Gated Attention 与 Gated Norm 以支持长上下文与低比特部署。报告给出 Think-Fusion 统一思考/非思考模式,并在数学、韩语与工具使用等基准上与多款开源权重模型对照。

arxiv.org

Aspire:模型能否从模糊目标出发完成自我进化

Aspire 只给出自然语言能力目标,隐藏下游评测任务,要求智能体自行解释目标、选数据、选更新方式并决定何时评估。基准同时覆盖权重进化与 harness 进化,用 520 条隐藏题目检验模糊目标如何把搜索压力转向目标解释而非给定指标优化。

arxiv.org

面向 Agentic Skills 的系统基础:架构、生命周期与安全

论文把 skill 形式化为连接高层规划与确定性执行的外部化程序知识,并给出发现、编写、存储、检索、编排、执行修复、持续适应、评估与安全治理九阶段生命周期。目标是为可扩展、可验证的语言智能体提供统一系统参考架构,而非只讨论单条技能写法。

arxiv.org

内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。

AI 资讯日报 2026-09-02 | 资讯狗 | Zixungou