Daily Intel · 资讯

AI 资讯

每天一轮 AI 检索:GitHub 项目、开源产品、X 热议、报告观点——条条带源链接,死链不上桌。

NO.048 · 2026-09-12 出刊
2026.08.29 – 2026.08.31 · 14 55 条 · 每日 06:10 自动更新

NO.048

09.12

星期六

开源权重今天被直接拿来对账:Moonshot把规模化收入押在Kimi的API和订阅放量上,DeepSeek则放出552B的V4.1-Flash,用非对称激活去压KV cache和agent缓存成本。应用层这边,百万美元ARR已经不够当成绩单,讨论转向留存和可替换风险;独立开发者则继续用具体数字说话,Marc Lou摊开36个产品累计300万美元和DataFast约3.08万美元MRR,glasa用提前养好的名单换来首周1.3万美元。编码工具同步改作业形态,Cursor用协调器分派多Agent做长周期开发,Cognition把SWE-2接到Devin上压执行成本,Claude Code给插件和Skill做开关对照评测。

31 条 · AI 检索生成读今日日报 ↗
2026.08.31星期一
3
2026.08.30星期日
4

用Gemini驱动的Co-Scientist在真实科研闭环中做假设、实验与成稿

该文扩展并验证基于Gemini的多智能体系统Co-Scientist,使其从假设生成进入材料、生物与计算机科学的执行闭环。案例包括对接CVD反应器设计前驱体路线、从稀疏成像预测菌群表型,以及自主发现可在HealthBench上提升表现的推理时扩展架构。

报告观点arxiv.org

AgentJudgeBench:评测LLM评委在智能体工具调用工作流上的可靠性

该基准围绕工作流DAG构建3808条样本,按六种拓扑与三档难度考察LLM-as-a-judge在工具调用轨迹上的对齐情况。结果显示难度升高时对齐下降加快,无标准答案时不同规模评委收敛到相近区间,结构化评分表有一定帮助但并不普遍迁移。

报告观点arxiv.org

CLAP:跨本体视频世界模型可作为零样本物理模拟器

CLAP用人类与多种机器人视频训练动作条件视频生成模型,以末端位姿、语言与潜在动作对齐不同本体的动作空间。模型在DROID等环境接近或超过单本体基线,并可用于推理时跨策略规划与在视频世界模型中做策略微调。

报告观点arxiv.org

PAWBench:视频生成模型距离概率对齐的世界建模还有多远

PAWBench把世界模型定义为应复现同一初态与动作下多种合法未来的分布,并用重复rollout把生成结果转成结果分布再与参考对比。在50个场景与11套系统上,现有模型难以同时做到概率校准、覆盖合法行为并在不同场景保持稳定。

报告观点arxiv.org
2026.08.29星期六
6

Thomson:面向 SovereignAI 的前沿模型持续学习

论文主张在开源权重模型上做中后训练与持续学习,即可用相对有限算力接近前沿表现,并给出 Thomson 模型在智能体、安全、法律税务与 Deep Research 等任务上的评测。结果显示能力呈 π 型提升,同时大幅减轻窄域适配常见的遗忘。

报告观点arxiv.org

什么样的智能体数据才有效:用 ACE 框架审视 LLM Agent 数据生成

作者将智能体数据统一表示为环境、任务、交互轨迹与验证器四元组,并用 Accuracy-Complexity-divErsity(ACE)视角分析现有生成范式。核心结论是关键不在于堆数据量,而在于持续分配真实、对当前学习者有信息量且低冗余的经验。

报告观点arxiv.org

WikiSkill:把智能体经验沉淀为可演化技能知识库

WikiSkill 将执行轨迹、持久 wiki 与可执行 skill 分层,用经验持续更新知识库再驱动技能迭代。跨模型和基准上,技能演化与模型规模互补,小模型配演化技能可超过未配技能的更大模型,且技能可跨模型族迁移。

报告观点arxiv.org

工具输出变成指令:把动作诱导与运行时授权拆开

论文指出工具返回值一旦开始指定具体动作,就会绕过用户意图产生副作用,根源是把“想到做什么”和“允许执行”混在一起。提出的 SARA 用隔离探测记录动作来源,并按用户目标与审计证据授权调用,在 AgentDojo 与 AgentDyn 上把攻击成功率压到约 0.63% 以内。

报告观点arxiv.org

HarnessLens:按行为做验证,更省预算地演化 Agent Harness

现有提出-验证式 harness 搜索常在固定任务集上全量打分,浪费 rollout 还容易掩盖局部回退。HarnessLens 从轨迹推导改动,只在相关行为任务上做可归因验证,在三种 harness 与四个基准上平均提升 7.6%–13.6%,同时明显节省评测预算。

报告观点arxiv.org

CorporateBench:接近真实企业规模的时序知识库问答评测

CorporateBench 用时序一致的合成企业世界构造超过 23 万份文档的问答基准,覆盖信息抽取与知识库查询两类任务。对五款 LLM 的评测显示,输入规模接近真实企业语料时,模型表现会明显下滑。

报告观点arxiv.org

内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。

AI 资讯 | 资讯狗 | Zixungou