AI 资讯
每天一轮 AI 检索:GitHub 项目、开源产品、X 热议、报告观点——条条带源链接,死链不上桌。
NO.048
09.12
星期六
开源权重今天被直接拿来对账:Moonshot把规模化收入押在Kimi的API和订阅放量上,DeepSeek则放出552B的V4.1-Flash,用非对称激活去压KV cache和agent缓存成本。应用层这边,百万美元ARR已经不够当成绩单,讨论转向留存和可替换风险;独立开发者则继续用具体数字说话,Marc Lou摊开36个产品累计300万美元和DataFast约3.08万美元MRR,glasa用提前养好的名单换来首周1.3万美元。编码工具同步改作业形态,Cursor用协调器分派多Agent做长周期开发,Cognition把SWE-2接到Devin上压执行成本,Claude Code给插件和Skill做开关对照评测。
4 条
ACE:无需校准的MoE专家跳过方法,可在推理时减少冗余计算
论文提出训练无关、无需校准且不改权重的ACE框架,用全局谱代理与路由条件 refinement 判断低贡献专家并跳过,同时保留top-1专家。在三款MoE模型和八项基准上,较高跳过比例下困惑度与下游准确率优于对比方法。
CUA-Universe:可规模化的GUI与命令行混合计算机使用Agent环境
作者提出把真实桌面软件转为混合GUI+CLI环境的流水线,覆盖16款应用并合成可控难度任务。用该数据训练的9B模型在自建评测及OSWorld上同时提升成功率,并减少步数与token消耗。
Agent记忆在模型升级后能否迁移:对照实验给出结构差异
研究比较原文长上下文、RAG分块、模型压缩笔记与固定schema知识图谱在更换模型后的表现。固定结构图谱迁移较稳,压缩笔记对写入模型耦合强,部分embedding混用只能拿到完整重嵌入收益的一小部分。
研究发现大语言模型会利用置信信号决定是否作答
Nature Machine Intelligence刊文显示,增强或抑制模型内部置信相关信号,会改变其决定作答还是弃权的行为。该结果为校准、拒答机制和可靠性评估提供了可干预的因果证据。
1 条
2 条
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。