news 2026/9/2 22:17:13

加入腾讯的姚顺雨发表首篇Paper!

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
加入腾讯的姚顺雨发表首篇Paper!

Datawhale学术

论文发表:姚顺雨,来源:PaperAgent

  • 2025.12.17 姚顺雨正式出任出任腾讯CEO / 总裁办公室首席 AI 科学家;兼任 AI Infra 部、大语言模型部负责人。

  • 2026.1.10 在 AGI-Next 前沿峰会上首秀亮相:做应用不仅需要强大的模型能力,还需要较长context(上下文/语境)

回到最近,腾讯混元&复旦联合发表的论文中《CL-bench》,姚顺雨也署名了!

CL-bench:A benchmark for Context Learning

CL-bench地址:

1. https://www.clbench.com/

2. https://github.com/Tencent-Hunyuan/CL-bench

3. https://huggingface.co/datasets/tencent/CL-bench

当然不是只挂名哦,姚顺雨(Shunyu Yao)全面而细致的审阅和反馈,极大地提升了这项工作的质量。

一、CL-BENCH价值

现有评测

痛点

静态知识问答(MMLU、C-Eval)

模型只靠预训练“老本”

长文档理解(LongBench、L-Eval)

考的是“找答案”,不是“学知识”

In-Context Learning(ICL)

只给几个样例,学的是“格式”而非“新知”

CL-BENCH 首次把“现学现卖”单独拎出来考

给一段全新、复杂、领域性强的上下文(最长 65 k tokens),再出 1~12 道必须依赖这段新知才能解的题目。

模型如果偷懒用预训练知识,几乎必挂(ablation 显示任务通过率 <1%)。

图 1:现学现卖 vs 传统 prompt 推理

二、CL-bench设计原则

CL-bench 围绕一个简单但严格的设计原则构建:每个任务都必须要求从 context 中学习新知识。 CL-bench 中的每个 context 都是完全自包含(Self-contained)的

解决任务所需的所有信息都显式地提供在 context 本身之中:不需要外部检索,也不允许隐藏假设。

解决CL-bench 中的任务需要模型从相应的 context 中学习新知识。

三、四大题型,18 个子类

考卷长啥样?

CL-bench 示例。解决这些任务要求语言模型从提供的 context 中学习。

图 3:上下文分类学

四、评分机制——“全或无”

每道题配套 10~20 条可自动判定的细项 rubric(格式、事实、计算、逻辑…)。

只有全部 rubric 通过才算 1 分,否则 0 分——彻底杜绝“差不多”。

表 4:LM-as-Judge 的 system prompt(节选)

Score = 1:学生答案必须**完美**满足 rubric 中**每一条**要求 Score = 0:只要有 1 条不满足

五、10 个前沿模型集体“翻车”

表 2:10 款模型全量结果

关键发现

  1. inductive ≪ deductive:需要“从数据归纳规律”的 Empirical Discovery 平均仅 11.8 %,比前三类低 6 个百分点。

  2. 长度即杀手:32 k tokens 以上文本,所有模型得分腰斩。

  3. 推理档位≠灵丹妙药:GPT-5.2 把推理从“low”拉到“high”,反而掉 5.6 %,暴露长链逻辑与指令跟随的失衡。

六、错误画像——模型都在怎么“偷懒”?

表 3:不同模型错误分布

一句话总结

CL-BENCH 像一场“闭卷速读+现场实操”的残酷考试,告诉咱们:现学现卖仍是下一代大模型最缺的通用能力

把这篇论文加入你的阅读清单,一起把模型逼成“10 分钟就能上手新业务”的超级打工人!

一起“赞”三连

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/27 14:59:51

Qwen-Ranker Pro多场景落地:智能制造设备手册与维修视频匹配

Qwen-Ranker Pro多场景落地&#xff1a;智能制造设备手册与维修视频匹配 1. 为什么设备维修总在“找不对”&#xff1f;一个被忽视的语义断层问题 你有没有遇到过这样的场景&#xff1a; 产线工程师急着修一台停摆的数控机床&#xff0c;打开企业知识库输入“主轴异响振动大”…

作者头像 李华
网站建设 2026/9/1 10:37:10

深求·墨鉴开箱测评:复杂表单识别效果惊艳展示

深求墨鉴开箱测评&#xff1a;复杂表单识别效果惊艳展示 1. 开箱即用&#xff1a;第一眼就让人想静下心来用 你有没有过这样的经历——拍了一张密密麻麻的报销单、一张带横线竖线的调查问卷、或者一页嵌套了三重表格的工程验收表&#xff0c;然后打开某个OCR工具&#xff0c;…

作者头像 李华
网站建设 2026/8/29 4:14:31

Qwen3-ASR-0.6B与SolidWorks集成:语音控制CAD设计

Qwen3-ASR-0.6B与SolidWorks集成&#xff1a;语音控制CAD设计 1. 当工程师开始“说话建模” 你有没有试过在SolidWorks里反复点击菜单、拖拽鼠标、输入尺寸&#xff0c;只为完成一个简单的拉伸操作&#xff1f;我做过三年机械设计&#xff0c;最常听到的抱怨不是“功能不够”…

作者头像 李华
网站建设 2026/9/2 14:03:57

3步搞定瑜伽女孩图片生成:雯雯的后宫-造相Z-Image快速入门

3步搞定瑜伽女孩图片生成&#xff1a;雯雯的后宫-造相Z-Image快速入门 你不需要懂模型原理、不用配环境、不装显卡驱动——只要会打字&#xff0c;就能在3分钟内生成一张高清、自然、细节丰富的瑜伽女孩图片。本文带你用“雯雯的后宫-造相Z-Image-瑜伽女孩”镜像&#xff0c;零…

作者头像 李华
网站建设 2026/8/30 5:27:11

Super Qwen Voice World代码实例:CSS Keyframes动画与TTS联动实现

Super Qwen Voice World代码实例&#xff1a;CSS Keyframes动画与TTS联动实现 1. 项目概览 Super Qwen Voice World是一个将复古像素风游戏界面与先进语音合成技术相结合的创新项目。它基于Qwen3-TTS模型构建&#xff0c;通过直观的游戏化界面让语音设计变得生动有趣。 1.1 …

作者头像 李华