AI 资讯
每天一轮 AI 检索:GitHub 项目、开源产品、X 热议、报告观点——条条带源链接,死链不上桌。
NO.048
09.12
星期六
开源权重今天被直接拿来对账:Moonshot把规模化收入押在Kimi的API和订阅放量上,DeepSeek则放出552B的V4.1-Flash,用非对称激活去压KV cache和agent缓存成本。应用层这边,百万美元ARR已经不够当成绩单,讨论转向留存和可替换风险;独立开发者则继续用具体数字说话,Marc Lou摊开36个产品累计300万美元和DataFast约3.08万美元MRR,glasa用提前养好的名单换来首周1.3万美元。编码工具同步改作业形态,Cursor用协调器分派多Agent做长周期开发,Cognition把SWE-2接到Devin上压执行成本,Claude Code给插件和Skill做开关对照评测。
4 条
JarvisGUI:跨设备GUI智能体动态任务组合评测基准
北航与百度团队提出JarvisGUI,把GUI任务建模为轻量类型系统下的输入输出变换,自动组合覆盖Android、Windows与Ubuntu的跨设备工作流。评测显示开源GUI智能体在状态迁移、跨平台上下文推理和长程依赖上仍明显落后于单设备表现。
A-MLE:用智能体系统加速工业广告排序中的机器学习迭代
该论文把广告排序模型的假设提出、实验执行与结果分析拆成五阶段,由单一LLM智能体调用领域技能并在沙箱中跑通实验,关键节点保留人工确认。作者在大规模排序模型上部署该系统,并比较Claude、Gemini与GPT家族在执行稳定性与探索激进程度上的差异。
TRACE:用仿真合成奖励训练因果探查推理智能体
TRACE通过向仿真器注入干预并生成可核验奖励,把难以直接标注的诊断推理任务纳入强化学习。在含12类根因的数字广告诊断环境中,经合成奖励训练的Qwen3.5-35B-A3B在归因指标上超过部分提示式前沿模型,同时调用更少工具。
ConvMem:用卷积式记忆做训练无关的长上下文推理
ConvMem把长文本推理改写成层次卷积,将LLM当作卷积核去汇总文本片段,并通过步长、跳跃连接与多核卷积降低误差累积。该方法无需训练即可并行处理长上下文,并在RULER相关多跳问答设置中超过对比基线。
5 条
ExecCritic:让编码智能体先学会写测试再据此改代码
论文将测试生成与源码修复拆成独立角色,并用角色专用强化学习分别训练基于 Qwen-3.5-35B-A3B 的 Test 与 Repair 智能体。在 SWE-bench Verified 上,两个经后训练的 Qwen 智能体组合达到 72.6% 解决率,较无测试基线高出 11.4 个百分点。
AgentIdeaBench:面向智能体时代的科学构想评测基准
该论文提出 AgentIdeaBench,在静态观察与主动探索两种设定下评测 33 个 LLM 的科学构想能力,覆盖五个学科的 40 个子领域。主动探索能暴露更大能力空间,收益主要落在可行性、清晰度与具体性,评测到的原创性则基本不变。
Procedural Graph:为 LLM 智能体构建可自演化的程序性执行结构
作者将程序性知识组织为(过程,关系,过程)三元组,在每一步用局部子图生成情境引导,而不直接指定动作。图结构可由失败与成功轨迹对比后自动改写,在多种任务与模型上相对基于记忆的基线带来稳定提升。
不可靠的进度条:LLM 智能体能在任务全程如实汇报进度吗
作者在 τ²-bench 与自建 StageIF 上评估模型在任务各阶段报告进度的可靠性,发现几乎所有受测模型都在部分阶段可靠、在另一些阶段失真。多数模型在任务进行中准确率下降、结束后回升,因此框架不宜仅凭模型自报状态来控制任务流。
Silent Revision:量化前沿 AI 开发者安全框架中的未披露修订
研究追踪 12 家已发布安全框架的开发者共 710 条承诺实例,约 67% 的实质性变更在开发者公开说明中未被点名。约 77% 的变更是弱化或删除承诺,作者主张公开义务应附带逐条枚举变更内容。
2 条
KOPA-Bench:面向韩国政务开放API的多步工具调用基准与数据合成方法
论文针对需在本地部署开源模型、并跨真实政府API做多步工具调用的场景,发布含145个真实任务的KOPA-Bench,以及基于在线执行校验的数据合成方法EDGE。9B模型经GRPO微调后接近同系列未微调27B模型,并在BFCL上同步提升。
建筑暖通系统中的大模型应用:方法、场景与落地就绪度综述
该综述编码了2023年至2026年3月间66篇LLM用于HVAC运维的同行评议研究,按应用族与方法族分类,并评估证据真实度与部署就绪度。结论认为现有工作多停留在研究阶段,更适合作为语义与工作流层,而非独立承担高频物理控制。
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。