AI 资讯
每天一轮 AI 检索:GitHub 项目、开源产品、X 热议、报告观点——条条带源链接,死链不上桌。
NO.048
09.12
星期六
开源权重今天被直接拿来对账:Moonshot把规模化收入押在Kimi的API和订阅放量上,DeepSeek则放出552B的V4.1-Flash,用非对称激活去压KV cache和agent缓存成本。应用层这边,百万美元ARR已经不够当成绩单,讨论转向留存和可替换风险;独立开发者则继续用具体数字说话,Marc Lou摊开36个产品累计300万美元和DataFast约3.08万美元MRR,glasa用提前养好的名单换来首周1.3万美元。编码工具同步改作业形态,Cursor用协调器分派多Agent做长周期开发,Cognition把SWE-2接到Devin上压执行成本,Claude Code给插件和Skill做开关对照评测。
3 条
自动化对齐研究者可稳定缓解模型对齐失效
Anthropic 于 8 月 28 日发布研究,用 Claude 作为 Automated Alignment Researcher,针对谄媚、越狱、欺骗等 10 类可量化对齐失效自动检索文献、提出训练方案并迭代微调。方法在目标基准上缩小安全缺口且未明显损伤通用能力,并可迁移到留出基准、Petri 多轮审计以及约 4.7 倍更大的模型。
校准够用来知道,却不够用来行动:伪造证据仍会让智能体对不可知问题拍板
对 12 个前沿模型的实验显示,把问题包进看起来专业的行情面板后,对可证不可预测问题的承诺率从 6.5% 升到 54.0%;面板数字全是编造时,承诺率仍与真实数据接近。模型能判断问题不可知,但行动闸门失效;对 3B 模型做少量监督微调可把原题承诺压到 0,不过刚性输出格式会让闸门再次失效。
大模型已能设计接近专用方法的运筹学算法
作者在库存控制、排队网络控制和组合优化三类问题上测试两级用法:直接解实例,或只看问题类描述后输出可复用算法。在单条未调 prompt 加固定预算 Python 沙箱下,gpt-5.6-sol 在多数实例上达到或超过既有专用方法,说明对表述清晰的 OR 问题,前沿模型已可当作经验基线。
4 条
用Gemini驱动的Co-Scientist在真实科研闭环中做假设、实验与成稿
该文扩展并验证基于Gemini的多智能体系统Co-Scientist,使其从假设生成进入材料、生物与计算机科学的执行闭环。案例包括对接CVD反应器设计前驱体路线、从稀疏成像预测菌群表型,以及自主发现可在HealthBench上提升表现的推理时扩展架构。
AgentJudgeBench:评测LLM评委在智能体工具调用工作流上的可靠性
该基准围绕工作流DAG构建3808条样本,按六种拓扑与三档难度考察LLM-as-a-judge在工具调用轨迹上的对齐情况。结果显示难度升高时对齐下降加快,无标准答案时不同规模评委收敛到相近区间,结构化评分表有一定帮助但并不普遍迁移。
CLAP:跨本体视频世界模型可作为零样本物理模拟器
CLAP用人类与多种机器人视频训练动作条件视频生成模型,以末端位姿、语言与潜在动作对齐不同本体的动作空间。模型在DROID等环境接近或超过单本体基线,并可用于推理时跨策略规划与在视频世界模型中做策略微调。
PAWBench:视频生成模型距离概率对齐的世界建模还有多远
PAWBench把世界模型定义为应复现同一初态与动作下多种合法未来的分布,并用重复rollout把生成结果转成结果分布再与参考对比。在50个场景与11套系统上,现有模型难以同时做到概率校准、覆盖合法行为并在不同场景保持稳定。
6 条
Thomson:面向 SovereignAI 的前沿模型持续学习
论文主张在开源权重模型上做中后训练与持续学习,即可用相对有限算力接近前沿表现,并给出 Thomson 模型在智能体、安全、法律税务与 Deep Research 等任务上的评测。结果显示能力呈 π 型提升,同时大幅减轻窄域适配常见的遗忘。
什么样的智能体数据才有效:用 ACE 框架审视 LLM Agent 数据生成
作者将智能体数据统一表示为环境、任务、交互轨迹与验证器四元组,并用 Accuracy-Complexity-divErsity(ACE)视角分析现有生成范式。核心结论是关键不在于堆数据量,而在于持续分配真实、对当前学习者有信息量且低冗余的经验。
WikiSkill:把智能体经验沉淀为可演化技能知识库
WikiSkill 将执行轨迹、持久 wiki 与可执行 skill 分层,用经验持续更新知识库再驱动技能迭代。跨模型和基准上,技能演化与模型规模互补,小模型配演化技能可超过未配技能的更大模型,且技能可跨模型族迁移。
工具输出变成指令:把动作诱导与运行时授权拆开
论文指出工具返回值一旦开始指定具体动作,就会绕过用户意图产生副作用,根源是把“想到做什么”和“允许执行”混在一起。提出的 SARA 用隔离探测记录动作来源,并按用户目标与审计证据授权调用,在 AgentDojo 与 AgentDyn 上把攻击成功率压到约 0.63% 以内。
HarnessLens:按行为做验证,更省预算地演化 Agent Harness
现有提出-验证式 harness 搜索常在固定任务集上全量打分,浪费 rollout 还容易掩盖局部回退。HarnessLens 从轨迹推导改动,只在相关行为任务上做可归因验证,在三种 harness 与四个基准上平均提升 7.6%–13.6%,同时明显节省评测预算。
CorporateBench:接近真实企业规模的时序知识库问答评测
CorporateBench 用时序一致的合成企业世界构造超过 23 万份文档的问答基准,覆盖信息抽取与知识库查询两类任务。对五款 LLM 的评测显示,输入规模接近真实企业语料时,模型表现会明显下滑。
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。