BridgeXLearning

AI 日报

AIHOT 每日报告 · 本地不可变归档

日报来自 AIHOT,每天 08:00(上海时区)发布并归档;历史报告不可变。AI 摘要未经 BridgeX 编辑审核,重要数字与原话请核对原文。

VOL.2026.07.1816 条摘要生成于 2026/07/19查看 AIHOT 日报页 ↗

01模型发布/更新

Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头

Kimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。

来源:X:阿易 AI Notes (@AYi_AInotes)核对原文 ↗AIHOT 详情 ↗

02产品发布/更新

Claude Code v2.1.212 发布

Claude Code v2.1.212 新增 `/fork` 命令,可将当前对话复制到新后台会话中独立运行。新增会话级 WebSearch 调用上限(默认 200)和子智能体生成上限(默认 200),防止失控循环。MCP 工具调用超过 2 分钟自动移至后台,并修复了计划模式自动执行文件修改命令等多项问题。

来源:Claude Code:GitHub Releases(RSS)核对原文 ↗AIHOT 详情 ↗

03行业动态

04论文研究

Schema Harness 在 ARC-AGI-3 公开集上取得约 99% 成绩

Schema 框架在 ARC-AGI-3 公开集上,使用 Claude Opus 4.8 和 Fable 5 达到 99% RHAE 分数,使用 GPT-5.6 Sol 达到 95.35%。该框架不修改模型权重,而是将原始观测转化为可编辑程序,联合解决状态归因和机制发现问题。此前最强模型 GPT-5.6 Sol 在半私有集上仅得 7.78%。

来源:Hacker News 热门(buzzing.cc 中文翻译)核对原文 ↗AIHOT 详情 ↗
美团LongCat发布LoHoSearch:更难搜索智能体基准

美团LongCat推出LoHoSearch,一个基于762万实体维基百科知识图谱自动生成问题的搜索智能体基准,旨在解决BrowseComp等现有基准趋于饱和的问题。在11个前沿模型测试中,最佳得分仅34.74%,远低于当前模型在BrowseComp上约90%的成绩;上下文策略仅带来+6.8个百分点的提升。该基准包含544道问题、11个领域,采用树与图结构,已开源。

来源:X:美团 LongCat (@Meituan_LongCat)核对原文 ↗AIHOT 详情 ↗
Apple 研究:Show Me Examples — 从图像集推断视觉概念

Apple 机器学习研究团队提出一种方法,让视觉语言模型(VLM)仅从图像集示例中推断视觉概念,无需文本指令。该方法通过对比示例图像与候选图像,使模型捕捉颜色、纹理等视觉规律,在多个概念推理基准上提升准确率。该研究目前为学术论文,未公布模型或 API 可用性。

来源:Apple Machine Learning Research(RSS)核对原文 ↗AIHOT 详情 ↗

05技巧与观点

首届“小有可为”大赛乡村教育一等奖作品“智绘科普”技术拆解

首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。

来源:公众号:通义实验室(千问)核对原文 ↗AIHOT 详情 ↗
生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。

来源:Hacker News 热门(buzzing.cc 中文翻译)核对原文 ↗AIHOT 详情 ↗