BridgeXLearning

AI 日报

AIHOT 每日报告 · 本地不可变归档

日报来自 AIHOT,每天 08:00(上海时区)发布并归档;历史报告不可变。AI 摘要未经 BridgeX 编辑审核,重要数字与原话请核对原文。

VOL.2026.05.3023 条摘要生成于 2026/06/02查看 AIHOT 日报页 ↗

01模型发布/更新

小米开源可控视频音效生成模型 ControlFoley,让声音“按你想要的来”

小米大模型应用团队发布开源可控视频音效生成模型 ControlFoley,旨在解决创作中的可控性难题。该模型统一支持文本引导视频配音、文本控制视频配音和参考音频控制视频配音三类任务。ControlFoley 在 VGGSound-Test 等多个 benchmark 上取得开源 SOTA 表现,其代码、模型权重和在线 Demo 均已开放。

来源:IT之家(RSS)核对原文 ↗AIHOT 详情 ↗

02产品发布/更新

Codex现已支持Windows端计算机使用功能

Windows用户,这条消息是给你的。 计算机使用功能现已在Windows上可用,因此Codex可以在你的Windows电脑上执行操作。 通过ChatGPT移动应用中Codex的Windows支持,你可以在工作继续在Windows电脑上进行时,随时随地启动、审查和引导任务。 这是一项早期体验,但我们正在努力提供更多方式,让你的工作无论身在何处都能持续进行。

来源:X:OpenAI (@OpenAI)核对原文 ↗AIHOT 详情 ↗
ComfyUI现已支持OpenRouter模型直接调用

现在你可以直接在ComfyUI工作流中使用你的OpenRouter模型了! [引用 @ComfyUI]:ComfyUI刚刚添加了@OpenRouter支持。 你不再局限于单一的大语言模型,现在可以直接在Comfy中访问20多个模型。 更多灵活性,更少摩擦,同样的工作流。 工作流链接在下方👇

来源:X:OpenRouter (@OpenRouter)核对原文 ↗AIHOT 详情 ↗
Runway API持续扩展模型与端点支持

我们持续为 Runway API 添加新模型和端点,以便您能将最佳生成能力直接集成到应用、产品和平台中。通过 Runway API,您可以在一个地方获得所需的所有模型,包括 Seedance 2.0、GPT Image 2、HappyHorse 1.0、Nano Banana Pro、Magnific Precision Upscaler V2 等更多内容。请通过下方链接开始使用。

来源:X:Runway (@runwayml)核对原文 ↗AIHOT 详情 ↗
OpenRouter支持模型生成文件补丁

OpenRouter 现已支持 "apply_patch",这是一个服务器工具,允许任何模型通过 Responses API 使用 V4A diffs 提出文件编辑建议。 模型生成一个补丁(创建、更新或删除文件)。OpenRouter 在服务器端验证 diff 语法。

来源:X:OpenRouter (@OpenRouter)核对原文 ↗AIHOT 详情 ↗

03行业动态

中央网信办等四部门:提升全民人工智能素养,加快人才培育、深化普及应用

中央网信办等四部门联合印发《2026年提升全民数字素养与技能工作要点》,部署了六项重点任务。其中明确要求“提升全民人工智能素养”,具体包括强化人工智能赋能教育、加快人工智能人才培育、深化人工智能普及应用。其他任务涵盖数字资源供给、应用场景建设、普惠包容发展、安全有序网络空间以及协同联动机制。

来源:IT之家(RSS)核对原文 ↗AIHOT 详情 ↗

04论文研究

05技巧与观点

这个 skill 看着不错,可将文字、URL 或文章直接生成公众号首图、小红书图文卡、教程步骤卡等视觉物料,支持 28 种布局和 10 种主题。

claude-design-card 是一款专为中文内容创作者设计的 Skill。它能将文字、URL 或文章直接转化为可发布的视觉卡片,如公众号首图、小红书图文卡、教程步骤卡等,支持 28 种布局与 10 种主题。其核心价值在于自动化了“写完文章”后最繁琐的流程:自动提炼重点、选择版式、生成 HTML 并截图成 PNG,替代了以往手动使用 Figma 或 Canva 等工具的步骤。该工具开源,适合经常撰写相关内容的创作者尝试。

来源:X:洪明 (@hongming731)核对原文 ↗AIHOT 详情 ↗
亲测为实:难以置信的推理速度

Kog团队在标准数据中心GPU上实现了极高的单用户推理速度,在8× AMD MI300X GPUs上达到3,000 tokens/s,在8× NVIDIA H200上达到2,100 tokens/s。相比常规推理速度(约100-300 tokens/s),实现了10-30倍提升。其核心思路是将LLM解码视为内存流问题,通过协同设计monokernel、重建同步机制、针对性内存访问映射及采用延迟张量并行的Laneformer模型架构,消除了传统流程的阻塞点。

来源:X:Rohan Paul (@rohanpaul_ai)核对原文 ↗AIHOT 详情 ↗
Adam’s Law:用高频词写Prompt效果更好

FaceMind团队用100种语言和四大核心任务实验发现,在语义不变的前提下,使用预训练语料中出现频率更高的词汇(高频表达)来撰写提示词或进行微调,可以显著提升大语言模型的表现。这被总结为Adam’s Law(文本频率定律),它为数据工程补上了“频率”这一新维度。原理在于高频表达能让模型在它最熟悉的概率空间内工作,从而优化输出质量。

来源:X:Berry Xia (@berryxia)核对原文 ↗AIHOT 详情 ↗
Cursor 团队发布《开发者习惯报告》

报告显示,AI正深刻改变开发工作形态。开发者周均代码产出从约3.6K行增至8.6K行,更大规模的PR(千行以上)占比上升。AI智能体在单次会话中的工具调用数增加约30%,正在处理更复杂的任务。同时,被接受的AI代码在60分钟后的留存率从约76%提升至约81%,表明更多AI生成内容进入了实际代码库。这些趋势共同指向AI已从个人辅助工具,演进为推动开发向更大规模任务与自动化基础设施发展的核心力量。

来源:X:邵猛 (@shao__meng)核对原文 ↗AIHOT 详情 ↗
特斯拉 FSD 安全性宣称遭质疑

特斯拉声称其全自动驾驶软件(FSD)安全性最高可达人类的10倍,但路透社调查发现此数据经不起推敲。参与训练FSD的员工表示该技术远未成熟,其安全演示高度依赖人工。统计方法被11位交通安全研究人员指出存在缺陷,例如与更广泛的联邦事故数据进行不恰当比较。相比之下,竞争对手Waymo采用了更严谨的统计方法。目前,特斯拉FSD仍需驾驶员主动监督,安全部署可能还需数年。

来源:IT之家(RSS)核对原文 ↗AIHOT 详情 ↗