AI 资讯日报 · Daily Digest

08.02

2026-08-02 · 星期日 · 06:20 截稿 · 覆盖近 1-3 天动态

NO.009
19 条 · 5 个分类
AI 检索生成

个体开发者继续把服务经验直接产品化,非技术背景的人用现成 AI 工具五个月做出三万美元月经常性收入的 Shopify 应用,全靠口碑;全职数据科学家的三个副业产品也稳住了近七千美元。OpenAI 称内部 Astra 模型用约两千美元算力解决了十个长期开放的数学与理论 CS 问题,并公开了 Lean 形式化证明。视频生成方面 MiniMax H3 和字节 Seedance 2.5 同时把时长与多模态参考往前推,华为与 LG 则分别开源了超大参数模型。

01

商业变现


2
02

产品发布


4
03

X 热议


4
04

开源产品


4
05

报告观点


5

AI代理能否进行开放式AI研究?来自两个案例研究的早期证据

作者提出影子评估方法,让前沿AI代理独立处理两篇未发表NeurIPS论文的核心研究问题,并投入六天时间与数千美元算力。结果显示代理可完成全部工程任务,但无法实质推进研究问题,并识别出五种常见失败模式。

arxiv.org

OSReward:建立跨平台计算机使用奖励模型的标准化评估

构建OSReward基准评估VLM作为计算机使用代理轨迹评判者的可靠性,并发布OS-Shepherd-100K数据集与开源奖励模型。研究发现前沿VLM存在系统性宽松偏差,开源模型可在更低成本下提供稳定信号。

arxiv.org

AISPA:面向大型语言模型应用的用户中心系统提示审计

提出AISPA框架,从用户视角审计系统提示的八个维度,并审查88个商业AI产品中的3249条指令。发现保护性指令普遍但覆盖浅层,问题指令仍广泛存在,提示设计差异显著。

arxiv.org

WIDE:通过令牌级动态宽度剪枝提升自适应LLM推理

提出端到端可微分令牌级动态宽度剪枝框架,支持预填充与解码阶段的细粒度稀疏计算。在50%稀疏度下实现显著质量保持与加速,内核级加速最高达4.95倍。

arxiv.org

DualG-MRAG:解耦宏观推理与微观匹配的多模态检索增强生成

提出双层图框架,将宏观拓扑推理与微观证据匹配解耦,并通过GNN检索器与动态编程解码提取推理路径。实验显示该方法在多跳多模态检索与复杂问答任务上优于现有基线。

arxiv.org

内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。

AI 资讯日报 2026-08-02 | 资讯狗 | Zixungou