09.01
2026-09-01 · 星期二 · 06:19 截稿 · 覆盖近 1-3 天动态
今天能对上账的几条生意,和一批往本机搬的工具叠在一起。Clipto 把本地视频、音频和文档做成可检索记忆,自称已做到约1500万美元年经常性收入并按净利盈利,同时以2.5亿美元投后估值完成融资;Fastlane 面向独立开发者的AI短视频工具软件端约6.9万美元月经常性收入,增长被归到大约2000次客户访谈,而不是某条流量捷径。另一头,OpenClaw 2.0、ODS、Open WebUI 和 Memoh 把本地推理、个人智能体和“每个 Agent 一台电脑”做成可自部署产品,MiniMind 则用单卡把64M小模型从预训练走到工具调用。云端同时在降价和铺渠道:GLM-5.3 Flash 输入输出大约减半,腾讯放出 Hy4 preview,AWS GovCloud 的 Bedrock 也接进多家前沿模型;对照的是 OpenAI 打算切断被 SpaceX 收购后的 Cursor 接口,欧盟把 ChatGPT 按超大型在线搜索引擎纳入 DSA。模型还在开源和打折,调用权和数据落点已经开始分开计价。
商业变现
3 条
Fastlane创始人访谈:AI短视频营销工具软件端约6.9万美元MRR
Gaurav在Starter Story访谈中称,面向独立开发者的AI短视频营销工具Fastlane软件订阅约6.9万美元MRR、付费用户超过1000。他将增长归因于约2000次客户访谈,而非单一流量玩法。
本地多模态搜索公司Clipto披露约1500万美元ARR并完成1500万美元融资
TechCrunch报道,Clipto创始人Henry Kang称公司在2026年初达到约1500万美元ARR且按净利口径盈利,并以2.5亿美元投后估值完成1500万美元股权融资。产品把本地视频、音频、文档做成可检索记忆,并接入MCP供Agent调用。
从时薪15美元做到100美元:AI训练与评估成为可核验副业路径
Business Insider刊出当事人自述:因找不到工作从每小时15美元的AI训练做起,通过专项评估后进入销售管理类高难度项目,近10个月稳定接到每小时100美元的评估单。该路径不依赖自有产品,但收入可按平台结算核验。
产品发布
5 条
腾讯开源并上线 Hy4 preview 生产力大模型
腾讯发布并开源 Hy4 preview,总参数约 770B、激活约 49B,上下文超过 1M tokens,面向编码、办公与科研。模型可通过 Hugging Face、腾讯云 TokenHub、OpenRouter 以及 CodeBuddy、WorkBuddy 等产品调用,WorkBuddy/CodeBuddy 上线两周免费。
GLM-5.3 Flash 输入输出价格下调约五成
AI Pricing Guru 8 月 29 日快照显示,GLM 5.3 Flash 输入从每百万 tokens 0.15 美元降至 0.075 美元,输出从 0.50 美元降至 0.25 美元,缓存输入同步减半。对高调用量的多模态与 Agent 工作负载,单位成本会明显下降。
Cloudflare AI Search 接入 GLM-5.3 Flash
Cloudflare 于 8 月 30 日宣布 AI Search 支持 @cf/zai-org/glm-5.3-flash 文本生成,模型在 Workers AI 上运行,上下文窗口约 104 万 tokens。开发者可在现有 AI Search 实例中切换该模型做检索增强生成。
InclusionAI 金融版 Ling 3.0 Flash Fin 登陆 Vercel AI Gateway
InclusionAI 基于 Ling 3.0 Flash 的金融向变体已上架 Vercel AI Gateway,上下文 256K,支持推理与函数调用。该通道在 9 月 25 日前免费,之后可按标准价续用或改用到期即停的免费模型 ID。
AWS GovCloud 的 Bedrock 开放多家前沿模型
AWS 于 8 月 30 日宣布 GovCloud(US)上的 Amazon Bedrock 新增 Anthropic Claude、Meta Llama、OpenAI、xAI Grok、NVIDIA Nemotron 及 Amazon Nova。政府与合规客户可在同一套安全与计费体系内切换模型。
X 热议
6 条
DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 开放权重
DeepSeek 以 MIT 协议放出 V4-Flash-Vision-Exp 权重、分词器与最小 PyTorch 推理实现,模型约 305B 参数。文本 Agent 能力与 V4-Flash 接近,视觉相关 Agent 评测相对纯文本版有明显提升。
Qwen3.8-27B EXL3 量化可在 24GB 显存跑超长上下文
社区放出 Qwen3.8-27B 的 EXL3 实验量化,配合 dflash2 可在 24GB 显存上服务 200k+ 上下文。该版本面向消费级 GPU 本地部署,作者提醒仍属实验发布,运行中可能遇到缺陷。
OpenAI 拟切断被 SpaceX 收购后的 Cursor 模型接口
OpenAI 以不向竞对共享技术为由,计划终止向被 SpaceX 收购的编程工具 Cursor 直接提供模型,提议截止日期约为 11 月 12 日。开发者圈在讨论 IDE 绑定风险、迁移窗口以及 Claude、Grok 等替代栈。
Google 发布 TimesFM-3 多变量时序基础模型
Google Research 推出 TimesFM-3,可在单次前向传播中完成多变量时序预测,并在公开基准上超过 Chronos 2、Toto 2.0 等模型。约 330M 参数便于本地运行,可把销量、促销和天气等序列交给专用模型而不是让 LLM 直接猜测。
欧盟将 ChatGPT 列为 DSA 超大型在线搜索引擎
欧委会认定 ChatGPT 欧盟月活超过 4500 万,按 DSA 将其定为 Very Large Online Search Engine,同期将 Reddit、Roblox 定为超大型平台。OpenAI 需在约四个月内完成系统性风险评估,覆盖非法内容、未成年人、选举与公共安全等义务。
NVIDIA 扩大与 MediaTek 合作并推进 NVLink Fusion
NVIDIA 宣布 MediaTek 将采用 NVLink Fusion,让客户自研 XPU 接入其机架级 AI 基础设施,合作覆盖数据中心、本地计算与汽车。同期市场报道称 NVIDIA 认购 MediaTek 约 35 亿美元可转债,引发对客户循环融资的讨论。
GitHub 项目
3 条
MiniMind:两小时从零训练 64M 参数小模型
用单卡 3090 走通预训练、SFT、LoRA、DPO/PPO 到 Tool Use 的完整链路,核心算法用原生 PyTorch 实现。适合想弄清 LLM 训练全流程的开发者对照复现。
ODS:把本机变成本地 AI 服务器
在 PC/Mac/Linux 上一键拉起本地推理、对话 UI、语音、Agent、工作流、RAG 和图像生成。适合不想把数据和推理都丢到云端的开发者搭私有栈。
heretic:自动解除语言模型审查层
对开源语言模型做自动化审查层剥离,方便研究对齐、拒绝样本和下游微调行为。适合评估模型安全策略对应用层的影响。
开源产品
4 条
OpenClaw 2.0(v2026.8.1)发布,可自部署个人智能体平台大改版
OpenClaw 以 v2026.8.1 作为 2.0 正式版上线,重做安装流程与浏览器 Control UI,并加入共享云端会话、记忆系统与多通道消息能力。该项目可在本机或自有服务器部署,对接本地模型及现有 ChatGPT/Claude 订阅。
Open WebUI v0.11.3 发布,自托管 AI 对话平台修复升级失败与会话分支
Open WebUI 在 8 月 31 日连续放出 v0.11.2 与 v0.11.3,修复数据库升级中途失败、聊天分支刷新后丢失等问题,并加强无障碍菜单对比度。该产品可用 Docker 一键自托管,对接 Ollama 与各类 OpenAI 兼容接口。
Langfuse v4.26.0 发布,开源 LLM 观测与评测平台可继续私有化部署
Langfuse 于 8 月 31 日连发 v4.25.0 与 v4.26.0,补充归一化 I/O 约定、评测器输出定义,并修正结构化输出与 OpenTelemetry 属性解析。该平台提供 Prompt 管理、链路追踪与数据集评测,可用 Docker Compose 自建。
Memoh v0.19.0 发布,给每个 Agent 独立电脑的多代理自托管平台
Memoh 在 8 月 30 日发布 v0.19.0,新增可配置 Bot Agent、定时任务全程可见,以及拖拽上传与流式回切等 Web 能力。每个智能体拥有独立桌面、浏览器与长期记忆,可用 Docker Compose 部署并接入飞书、微信等通道。
报告观点
6 条
openJiuwen:面向长程编程智能体的可组合自适应Harness
该开源框架用共享执行基底和Rail能力组合,同时支持单智能体、子智能体委托与Swarm Flow,并让运行时根据诊断与执行证据动态调整上下文与任务控制。在SWE-bench Verified和Terminal-Bench 2.1上分别达到82.6%与87.19%。
CNeo-Bench:用中文新词机制诊断大语言模型
论文构建含4759条中文新词的基准,按谐音、拆字等语言机制分成五类九亚类,并区分“能否解释”与“能否操作其生成机制”。18个模型多数在释义生成上低于40%,且常把源形式还原成近义改写而非原词。
ContextPilot:用细粒度强化学习让智能体主动管理上下文
针对长程智能体上下文膨胀,作者扩展规划、长期记忆与软卸载工具,并用上下文与熵变化定位关键编辑动作来做分支采样与动作级优势估计。在长上下文问答和深度搜索任务上,可用更紧凑工作上下文取得更高表现。
通信高效MoE:用层重构降低专家并行训练开销
CE-MoE把专家容量集中到少数路由层,同时用额外token-mixing与稠密FFN维持深度,以降低all-to-all调度占比。在2B到31.5B、总参数与激活参数对齐的条件下,31.5B规模可减少约33.3% GPU小时并保持验证损失与下游分数。
H-Scale:面向NVFP4亚字节推理的Hessian引导缩放 refinement
针对Blackwell原生NVFP4微块缩放空间过大、现有PTQ偏重权重量化的问题,H-Scale用校准激活的对角二阶近似选择硬件合法的组缩放,直接压低层输出扰动。方法可替换RTN式缩放选择,离线校准成本低,推理零额外开销。
多智体失败归因:只让“关键出错智能体”做反思
DoCtOR先自动定位决定性错误步骤与出错智能体,再用反事实修正该步,并仅让该智能体生成针对性反思,避免其他智能体记忆被污染。在HotPotQA、ChartQAPro和Mind2Web上相对初始成功率分别提升22%、26%和27%。
内容由 AI 检索生成,每日自动更新,可能存在错漏;事实与数据以源链接为准。资讯狗不对第三方链接内容负责。