提示词压缩:把认知科学和提示词工程打通
目录
- 提示词压缩:把认知科学和提示词工程打通
- 一、大脑如何判断"什么信息重要"
- 1. 预测编码(Predictive Coding)——最底层的判断标准
- 2. 自上而下注意力(Top-down Attention)——任务驱动的门控
- 3. 工作记忆瓶颈——容量硬限制
- 4. 语义图式(Schema)——编码效率的决定因素
- 5. 记忆巩固——重复与情绪决定长期保留
- 6. 突触修剪(Synaptic Pruning)——用进废退
- 二、对提示词压缩的核心启发
- 三、现有提示词压缩方案及优缺点
- 方案1:Token级熵压缩(LLMLingua / LongLLMLingua)
- 方案2:LLM摘要压缩(GPT-Compressor / Prompt Summarization)
- 方案3:检索选择性保留(Selective Context / RAG-based Compression)
- 方案4:语义嵌入聚类(Embedding Clustering)
- 方案5:模板化/变量化(Template-based / Few-shot Abstraction)
- 方案6:工程层缓存(Prefix Caching / KV Cache优化)
- 四、具体案例:API代码生成Prompt的压缩
- 原始Prompt(约380字)
- 压缩后(约75字,压缩率约5×)
- 逐段分析:为什么删、为什么留
- 五、映射关系图
- 六、为什么这套映射有效——LLM与大脑的深层同构
- 七、一句话总结
一、大脑如何判断"什么信息重要"
大脑不是被动存储信息的硬盘,而是一个预测机器+筛选器。它通过六层机制决定哪些信息值得进入意识、被记住、被调用:
1. 预测编码(Predictive Coding)——最底层的判断标准
大脑持续对感官输入做预测,只把预测误差(意外、不符合预期的部分)向上传递。符合预期的信息被自动抑制,因为它不携带新信息。
- 你走进熟悉的办公室,不会注意到每把椅子的位置——预测为零,被过滤。
- 但如果桌上多了一个陌生包裹,预测误差拉满,注意力立刻被捕获。
2. 自上而下注意力(Top-down Attention)——任务驱动的门控
前额叶皮层根据当前目标,主动放行与任务相关的信息,抑制无关输入。
- 你在嘈杂餐厅里能专注听朋友说话(鸡尾酒会效应),因为目标是"对话"。
- 但如果有人喊你的名字,即使声音小也会被听到——自下而上的显著性打断了自上而下的过滤。
3. 工作记忆瓶颈——容量硬限制
工作记忆只能同时容纳约4个组块(不是经典的7±2,后续研究修正为4)。信息必须被组块化(chunking)才能进入:
- “19491001