news 2026/9/2 22:53:01

【LLM】CL-bench:评估LLM学新知识的能力

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【LLM】CL-bench:评估LLM学新知识的能力

note

  • CL-bench 围绕一个简单但严格的设计原则构建:每个任务都必须要求从 context 中学习新知识。 CL-bench 中的每个 context 都是完全自包含(Self-contained)的。解决任务所需的所有信息都显式地提供在 context 本身之中:不需要外部检索,也不允许隐藏假设。
  • CL-bench 揭示了一个不能被忽视的现象:当今的前沿语言模型还仍然不会利用 context ,从 context 中学习。

文章目录

  • note
  • 一、CL-bench覆盖的内容
  • 二、CL-bench设计原则
  • 三、CL-bench评估结果
  • Reference

一、CL-bench覆盖的内容

1、CL-bench 涵盖了四种广泛的现实世界 context 学习场景:

领域知识推理: context 中提供特定的领域知识(例如 虚构的法律体系、创新的金融工具或小众专业知识)。模型需要利用这些知识来推理并解决具体问题。

规则系统应用: context 中提供新定义的正式系统(例如 新的游戏机制、数学形式体系、编程语法或技术标准)。模型必须理解并应用这些规则来执行任务。

程序性任务执行: context 中提供复杂的过程系统(例如 工作流、产品手册和操作指南)。模型必须理解并应用这些程序性信息来完成任务。

经验发现与模拟: context 中提供复杂系统内的实验数据、观测记录或模拟环境。与前几类涉及演绎推理不同,这一类专注于归纳推理,也是最具挑战性的。模型必须从数据中发现潜在的定律或结论,并应用它们来解决任务。

二、CL-bench设计原则

CL-bench 围绕一个简单但严格的设计原则构建:每个任务都必须要求从 context 中学习新知识。 CL-bench 中的每个 context 都是完全自包含(Self-contained)的。解决任务所需的所有信息都显式地提供在 context 本身之中:不需要外部检索,也不允许隐藏假设。

三、CL-bench评估结果

结果揭示了当前模型几乎不能从复杂 context 中学习来解决真实场景的问题。实验也解释了一些更有趣的发现。平均而言,模型仅解决了 17.2% 的任务。即便是表现最好的模型 GPT-5.1 (High),也仅达到了 23.7%。换句话说,尽管 context 中拥有解决每个任务所需的全部信息,模型在绝大多数任务上都失败了。这表明当前最前沿的模型几乎不会从 context 中学习。

Reference

[1] https://hy.tencent.com/research/100025?langVersion=zh

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 9:24:09

使用 Depth Anything V2 进行单目深度估计

原文:towardsdatascience.com/monocular-depth-estimation-with-depth-anything-v2-54b6775abc9f?sourcecollection_archive---------4-----------------------#2024-07-24 神经网络是如何从二维图像中学习估计深度的? https://medium.com/neural.avb?…

作者头像 李华
网站建设 2026/9/2 22:10:04

什么是住宅代理IP?

什么是住宅代理IP? 住宅代理IP是一种特殊类型的代理服务,采用的IP地址为居民住宅网络IP地址。这种特殊类型的代理服务可以模拟真实用户的上网行为和位置信息,从而更好地保护用户的隐私,并且比其他类型的代理服务更难被网站或应用…

作者头像 李华
网站建设 2026/9/2 22:09:51

Ps:清晰度和去除薄雾

清晰度和去除薄雾 Clarity and Dehaze是 Photoshop 中源自 Camera Raw 的核心影像结构调整算法,在 Ps 里以调整图层的形式出现,使用户能够在不破坏原图的前提下,对画面结构对比和空气感进行精确控制。Ps菜单:图层 / 新建调整图层 …

作者头像 李华
网站建设 2026/9/2 22:44:08

单声道到立体声:AI 如何为音乐注入新生命

原文:towardsdatascience.com/mono-to-stereo-how-ai-is-breathing-new-life-into-music-4180f1357db4?sourcecollection_archive---------4-----------------------#2024-12-24 AI 单声道到立体声升混的应用与技术 https://medium.com/maxhilsdorf?sourcepost_p…

作者头像 李华
网站建设 2026/8/27 8:09:59

Qwen3-VL-Reranker-8B应用场景:医疗影像报告图文混合语义检索系统

Qwen3-VL-Reranker-8B应用场景:医疗影像报告图文混合语义检索系统 1. 这不是普通“搜图”,而是让医生秒懂影像与报告的关联 你有没有遇到过这样的场景:一位放射科医生在查阅某位肺癌患者的CT影像时,想快速找到过去三年内所有相似…

作者头像 李华