把"任务"当交互单元:多模态上下文如何让AI智能体一次做对
DAIR.AI 创始人 Elvis Saravia 提出以"任务"取代"提示词"作为 AI 智能体的交互单元,把语音、屏幕画面、文本、标注打包成完整上下文,让模型一次拿够信息,减少来回修正。该思路受 Karpathy 长语音实验启发,或将重塑 Agent 的前端采集和产品形态。

DAIR.AI 创始人 Elvis Saravia 近日在 X 上抛出一个新提法:与其让 AI 智能体围绕
反复来回,不如把
作为新的交互单元。他主张把语音、屏幕画面、文本、标注等多模态信息一次性打包给模型,让智能体在动手前就拿到完整上下文。
从提示词到任务:交互颗粒度的迁移
提示词工程火了两年,几乎成了 AI 应用的显学。但现实并不顺滑:用户问一句,模型答一句,缺信息就追问,一个简单任务被切成几十次往返。Saravia 把症结归结到交互颗粒度太碎——上下文被切碎后,模型只能靠猜。
他的解法是把整件事当一个
丢进去,让模型一次做对。这意味着开发者要重新设计前端采集层,把多模态信号统一封装成任务包,而不是让用户一次次手动补充信息。
灵感来自一段长语音提示
这次提法并非凭空。Saravia 引用了 Andrej Karpathy 的一个实验:把一段长语音直接当提示词喂给模型,效果比短文本好得多。这印证了一个直觉——大模型对上下文的吸收能力被低估了,前提是上下文要一次给齐,而不是零散追加。这也是
单元能成立的根基。
对开发者和企业意味着什么
这套思路一旦落地,最先受益的是客服、运维、设计这类需要看屏幕、听语音的工种。它们天然依赖多模态上下文,传统文本对话根本承载不了。
- Agent 框架:需要把语音、视觉、标注统一封装成
- 企业落地:减少对话轮次,可压低 token 成本和等待时长- 开发者能力迁移:从
转向
- 产品形态:单轮复杂任务会成为新的评测基准
中文用户该关注什么
国内其实已经出现类似产品形态:带屏幕理解的桌面助手、带语音批注的会议 Agent、电商场景的图文混检工具,都在朝
的方向走。
但中文场景的多模态更难——截图里夹中英文、聊天窗口混表情包、表格里嵌拼音,模型要一次看懂并不容易,对 OCR、视觉理解、长上下文都是综合考验。这也是国内团队最容易拉开差距的地方。
Saravia 的提法目前停在方法论层面,没有具体产品或代码。后续值得看三点:DAIR.AI 是否给出参考实现、主流 Agent 框架是否原生支持
概念、多模态长上下文在企业里的实际成本能否打平。短期内提示词工程不会消失;**
作为新交互单元**的方向已经清晰,谁先把多模态上下文封装好用,谁就更接近真正的智能体体验。
同主题阅读路径
查看「模型发布」栏目读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。
查看 AI 工具