AI 资讯日报 · Daily Digest

09.01

2026-09-01 · 星期二 · 06:19 截稿 · 覆盖近 1-3 天动态

NO.037
27 条 · 6 个分类
AI 检索生成

今天能对上账的几条生意,和一批往本机搬的工具叠在一起。Clipto 把本地视频、音频和文档做成可检索记忆,自称已做到约1500万美元年经常性收入并按净利盈利,同时以2.5亿美元投后估值完成融资;Fastlane 面向独立开发者的AI短视频工具软件端约6.9万美元月经常性收入,增长被归到大约2000次客户访谈,而不是某条流量捷径。另一头,OpenClaw 2.0、ODS、Open WebUI 和 Memoh 把本地推理、个人智能体和“每个 Agent 一台电脑”做成可自部署产品,MiniMind 则用单卡把64M小模型从预训练走到工具调用。云端同时在降价和铺渠道:GLM-5.3 Flash 输入输出大约减半,腾讯放出 Hy4 preview,AWS GovCloud 的 Bedrock 也接进多家前沿模型;对照的是 OpenAI 打算切断被 SpaceX 收购后的 Cursor 接口,欧盟把 ChatGPT 按超大型在线搜索引擎纳入 DSA。模型还在开源和打折,调用权和数据落点已经开始分开计价。

01

商业变现


3
02

产品发布


5

腾讯开源并上线 Hy4 preview 生产力大模型

腾讯发布并开源 Hy4 preview,总参数约 770B、激活约 49B,上下文超过 1M tokens,面向编码、办公与科研。模型可通过 Hugging Face、腾讯云 TokenHub、OpenRouter 以及 CodeBuddy、WorkBuddy 等产品调用,WorkBuddy/CodeBuddy 上线两周免费。

tencent.com

GLM-5.3 Flash 输入输出价格下调约五成

AI Pricing Guru 8 月 29 日快照显示,GLM 5.3 Flash 输入从每百万 tokens 0.15 美元降至 0.075 美元,输出从 0.50 美元降至 0.25 美元,缓存输入同步减半。对高调用量的多模态与 Agent 工作负载,单位成本会明显下降。

aipricing.guru

Cloudflare AI Search 接入 GLM-5.3 Flash

Cloudflare 于 8 月 30 日宣布 AI Search 支持 @cf/zai-org/glm-5.3-flash 文本生成,模型在 Workers AI 上运行,上下文窗口约 104 万 tokens。开发者可在现有 AI Search 实例中切换该模型做检索增强生成。

developers.cloudflare.com

InclusionAI 金融版 Ling 3.0 Flash Fin 登陆 Vercel AI Gateway

InclusionAI 基于 Ling 3.0 Flash 的金融向变体已上架 Vercel AI Gateway,上下文 256K,支持推理与函数调用。该通道在 9 月 25 日前免费,之后可按标准价续用或改用到期即停的免费模型 ID。

vercel.com

AWS GovCloud 的 Bedrock 开放多家前沿模型

AWS 于 8 月 30 日宣布 GovCloud(US)上的 Amazon Bedrock 新增 Anthropic Claude、Meta Llama、OpenAI、xAI Grok、NVIDIA Nemotron 及 Amazon Nova。政府与合规客户可在同一套安全与计费体系内切换模型。

aws.amazon.com
03

X 热议


6

DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 开放权重

DeepSeek 以 MIT 协议放出 V4-Flash-Vision-Exp 权重、分词器与最小 PyTorch 推理实现,模型约 305B 参数。文本 Agent 能力与 V4-Flash 接近,视觉相关 Agent 评测相对纯文本版有明显提升。

huggingface.co

Qwen3.8-27B EXL3 量化可在 24GB 显存跑超长上下文

社区放出 Qwen3.8-27B 的 EXL3 实验量化,配合 dflash2 可在 24GB 显存上服务 200k+ 上下文。该版本面向消费级 GPU 本地部署,作者提醒仍属实验发布,运行中可能遇到缺陷。

x.com

OpenAI 拟切断被 SpaceX 收购后的 Cursor 模型接口

OpenAI 以不向竞对共享技术为由,计划终止向被 SpaceX 收购的编程工具 Cursor 直接提供模型,提议截止日期约为 11 月 12 日。开发者圈在讨论 IDE 绑定风险、迁移窗口以及 Claude、Grok 等替代栈。

x.com

Google 发布 TimesFM-3 多变量时序基础模型

Google Research 推出 TimesFM-3,可在单次前向传播中完成多变量时序预测,并在公开基准上超过 Chronos 2、Toto 2.0 等模型。约 330M 参数便于本地运行,可把销量、促销和天气等序列交给专用模型而不是让 LLM 直接猜测。

x.com

欧盟将 ChatGPT 列为 DSA 超大型在线搜索引擎

欧委会认定 ChatGPT 欧盟月活超过 4500 万,按 DSA 将其定为 Very Large Online Search Engine,同期将 Reddit、Roblox 定为超大型平台。OpenAI 需在约四个月内完成系统性风险评估,覆盖非法内容、未成年人、选举与公共安全等义务。

politico.eu

NVIDIA 扩大与 MediaTek 合作并推进 NVLink Fusion

NVIDIA 宣布 MediaTek 将采用 NVLink Fusion,让客户自研 XPU 接入其机架级 AI 基础设施,合作覆盖数据中心、本地计算与汽车。同期市场报道称 NVIDIA 认购 MediaTek 约 35 亿美元可转债,引发对客户循环融资的讨论。

x.com
04

GitHub 项目


3
05

开源产品


4
06

报告观点


6

openJiuwen:面向长程编程智能体的可组合自适应Harness

该开源框架用共享执行基底和Rail能力组合,同时支持单智能体、子智能体委托与Swarm Flow,并让运行时根据诊断与执行证据动态调整上下文与任务控制。在SWE-bench Verified和Terminal-Bench 2.1上分别达到82.6%与87.19%。

arxiv.org

CNeo-Bench:用中文新词机制诊断大语言模型

论文构建含4759条中文新词的基准,按谐音、拆字等语言机制分成五类九亚类,并区分“能否解释”与“能否操作其生成机制”。18个模型多数在释义生成上低于40%,且常把源形式还原成近义改写而非原词。

arxiv.org

ContextPilot:用细粒度强化学习让智能体主动管理上下文

针对长程智能体上下文膨胀,作者扩展规划、长期记忆与软卸载工具,并用上下文与熵变化定位关键编辑动作来做分支采样与动作级优势估计。在长上下文问答和深度搜索任务上,可用更紧凑工作上下文取得更高表现。

arxiv.org

通信高效MoE:用层重构降低专家并行训练开销

CE-MoE把专家容量集中到少数路由层,同时用额外token-mixing与稠密FFN维持深度,以降低all-to-all调度占比。在2B到31.5B、总参数与激活参数对齐的条件下,31.5B规模可减少约33.3% GPU小时并保持验证损失与下游分数。

arxiv.org

H-Scale:面向NVFP4亚字节推理的Hessian引导缩放 refinement

针对Blackwell原生NVFP4微块缩放空间过大、现有PTQ偏重权重量化的问题,H-Scale用校准激活的对角二阶近似选择硬件合法的组缩放,直接压低层输出扰动。方法可替换RTN式缩放选择,离线校准成本低,推理零额外开销。

arxiv.org

多智体失败归因:只让“关键出错智能体”做反思

DoCtOR先自动定位决定性错误步骤与出错智能体,再用反事实修正该步,并仅让该智能体生成针对性反思,避免其他智能体记忆被污染。在HotPotQA、ChartQAPro和Mind2Web上相对初始成功率分别提升22%、26%和27%。

arxiv.org

内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。

AI 资讯日报 2026-09-01 | 资讯狗 | Zixungou