独特的视角分析 LLM 从底层模型到应用接口的多层次抽象,帮助开发者深化对 LLM 技术栈的理解。
我们经常会从不同的层级或抽象程度来理解同一条信息。来看一个简单的例子:
这是一条鱼的特写——我们能看到它的鳞片、鱼鳍的纹理,以及眼睛里若隐若现的倒影。
稍微拉远一点,细节渐渐淡去,周围的海洋进入视野。
继续拉远,这条鱼就只剩下鱼群中的几抹色彩。
地图的工作方式也很相似。
查看国家动物园的局部区域时,我们可以看到道路、建筑,甚至动物围栏!
稍微缩小一点,现在看到的重点变成了街区——公园、商店和街道。
继续缩小,你看到的便是一座城市,只留下高速公路和地形。
每个层级呈现的信息都截然不同,具体取决于 Google 认为用户可能对什么感兴趣。在以多种方式呈现同一份信息这件事上,地图堪称视觉化设计的典范。
到目前为止,这些都是我们熟悉的例子。如果把同样的原则应用到文本上,会怎么样?
来看一下《变形记》的开篇段落。
一天清晨,格里高尔·萨姆沙从不安的梦中醒来,发现自己躺在床上,变成了一只巨大的甲虫。他仰卧在坚硬得仿佛披着铠甲的背上,稍稍抬起头,便能看见自己圆顶般的棕色腹部;腹部被一道道僵硬的弧形纹路分隔开来,盖在上面的被子几乎无法保持原位,眼看就要完全滑落。他那许多条腿,与庞大的身体相比细得可怜,正在眼前无助地挥动。
稍微提高一点抽象层级,我们可以去掉一些细节。
格里高尔·萨姆沙从不安的睡梦中醒来,发现自己变成了一只巨大的甲虫。他被困在床上,仰躺在坚硬的甲壳状背部,注视着自己新出现的分节腹部和无助挥动的细腿。
如果完全拉远,我们可以用一句话概括这个段落。
一个男人在睡梦中意外变成了甲虫。
看到了吗?即使是文本,我们也能从不同的抽象层级来阅读。感兴趣的话,可以看看我在 2023 年 AI Engineer Summit 演讲中分享的更多细节。
从不同抽象层级查看同一段文本非常有用。但如果我们不在这些层级之间来回切换,而是同时看到多个层级呢?这会如何实现?
我们可以从摄影中寻找一个类比。人像镜头让单个主体清晰对焦,同时将其与背景分离,让所有注意力都集中在主体的细节上。广角镜头则会捕捉更大的场景,展示主体与周围环境之间的关系。然后是鱼眼镜头——它能同时做到这两点:把中心区域拉近,又让边缘弯曲,从而展现完整的上下文。
鱼眼镜头并不要求我们在焦点与上下文之间二选一——它让我们能够同时体验两者。这为我们提供了一个很好的灵感:在给出详细答案的同时,也揭示周围的联系与结构。
我们经常只拿到一小段脱离上下文的文本:书中的一句引文、Wikipedia 文章中的一个段落,或者电影剧本里的一句台词。你只能自己补全上下文,而且往往补得并不准确。
以《权力的游戏》中的这句引文为例:
如果缺少 Westeros 即将面临威胁这一背景,它就只是一则天气预报。但放在整个系列中,它却是对生存危机的不祥警告。脱离上下文阅读引文,就像只看一个场景便试图理解整部电影:注定是不完整的。
假设你正在阅读格林兄弟的《小精灵与鞋匠》。你读到一个段落,描写鞋匠发现了小精灵留下的、尺寸小巧却制作精美的鞋子。如果没有上下文,这个段落只不过是一个耐人寻味的瞬间。
现在设想一下:你不必读完整本书,只需将鼠标悬停在这个段落上,就能立刻看到故事的分层视图。最贴近当前内容的一层,可以概括这个时刻之前发生的事情:鞋匠生活贫困、苦苦挣扎,在夜里把自己最后一点皮革留在了外面。再上一层可以让你更全面地了解此前的故事:在这些小小恩人的帮助下,鞋匠的生意神秘地恢复了生机。更高层级的摘要甚至可以预告故事的结局:鞋匠和妻子为小精灵制作衣服,以此表达感谢。
这种方式可以帮助你迅速找到自己在故事中的位置,而不必通过线性阅读一点点拼凑全部信息。你既能看到段落本身的细节,又能更深入地理解它如何融入整个故事。
这个具体示例并不算最好,但没办法,身边有个宝宝时,一天里能拿来写代码的时间实在有限。不过,我能想象出一些更具吸引力的变体。哪怕只是在文章中提供一个“摘取引文”的交互,并在引文周围自动补充一些上下文,也会非常有用。
想想我们通常是如何学习的。拿起一本书,每一条信息都被上下文包围。章节提供了结构,把每个观点与它前后的观点连接起来。一位优秀的作者会铺设背景,通过轶事、历史背景或主题线索让你沉浸其中,帮助你理解具体细节。甚至翻阅一本书这个动作——看一眼封面、目录和几个标记过的章节——都能让你置身于一个更宏大的叙事之中。
再想想向一个人学习某件事的情形。假设一位朋友向你介绍观赏金鱼。他的讲解不会止步于说出 Oranda 这个名字——他可能会告诉你第一次在哪里见到它、为什么觉得它很迷人,或者它为何是中国文化中深受喜爱的品种,象征着幸运与繁荣。信息由谁告诉你——这个人的专业知识、兴趣或个人经历——会影响你如何理解它。
博物馆也是如此:当你看到展览中陈列的一条鱼时,下方的说明牌不会只告诉你物种名称。它还会介绍这种鱼生活在哪里、如何演化,甚至可能讲述它在艺术或神话中的意义。展览把这条鱼放进一个知识生态系统中,帮助你获得超越名称本身的理解。
但当你询问 LLM 聊天机器人时,这些内容全都没有。就好像你随手把一本书翻到某一页,只读了其中一个随机句子,然后又把书合上。当然,答案可能准确,甚至很有帮助——但那些让学习变得有意义、变得完整的周边上下文,全被剥离了。
假设你在度假时拍了一条鱼,想知道它是什么。
这似乎是一种观赏金鱼,很可能是 Oranda 或 Fantail Goldfish,其特征是飘逸的鱼鳍和鲜艳的色彩。
说真的,这个回答并不差!但我们的视角完全聚焦在问题的答案上。你当然可以继续追问——Oranda 吃什么、生活在哪里、与其他金鱼相比有什么不同?——但你必须自己知道下一步该问什么。聊天机器人是被动响应的,而不是主动引导的。除非你本来就是鱼类学爱好者,否则你甚至可能不知道应该从哪些问题入手,继续深入探索。
我们不妨重新想象一下 Wikipedia。在页面中央,你会看到一篇详细介绍观赏金鱼的文章——它们的栖息地、种类,以及在食物链中的角色。周围则分布着更宽泛的主题,例如观赏鱼;相似主题,例如 Koi fish;更具体的主题,例如 Oranda goldfish;以及相关人物,例如让它们流行起来的设计者。
点击另一个主题后,它会移动到中央并展开完整细节,周围的上下文也会随之调整。这种体验是动态的、引人入胜的,而最重要的是,它让你始终与知识网络保持连接。
观赏金鱼是一类经过驯化的金鱼品种,因独特的身体特征和观赏用途而被培育。与普通金鱼不同,它们拥有凸出的眼睛、华丽的鱼鳍和圆润的体形等鲜明特征。这些装饰性鱼类起源于中国,在家庭水族箱和观赏池塘中非常受欢迎。它们拥有多种颜色和类型,包括 Ranchu、Oranda 和 Telescope goldfish。观赏金鱼虽然美丽,但由于选择性繁育,它们的寿命通常更短,体质也不如野生近亲强健。
独特的日本观赏金鱼品种
是一种创造……的方法
金鱼选择性繁育
对金鱼特征的遗传操控
需要运用专门的
金鱼繁育技术
金鱼选择性繁殖的科学方法
Telescope Eye Goldfish
眼睛突出的金鱼品种
池塘养殖中的观赏性彩色鱼类
是……的主要场景
维护观赏鱼生活环境的爱好
源自……的过程
通过遗传操控强化特定性状
是……的一项专门实践
培育观赏品种的专业实践
为美观而培育的装饰性水生物种
在生物分类上属于
庞大的淡水鱼类家族
源自……的过程
通过遗传操控强化特定性状
养鱼的艺术与科学
日本金鱼繁育者与爱好者专家
杰出的水族研究者与金鱼遗传学家
由……开发并完善
专业金鱼繁育者与专家
国际观赏鱼繁育专家
你是在围绕一个概念学习,沉浸于彼此连接的思想网络中,一个答案会激发你对下一个问题的好奇心。
我们还可以在哪里使用鱼眼镜头?
时间线 关键里程碑以丰富的细节呈现,而周围事件逐渐淡化为摘要,帮助你把历史看作一个动态的连续体。
代码 想象一个代码编辑器:你正在处理的函数会被完整展开,相关函数在附近以摘要形式呈现,而代码库的整体结构则在更高层级上进行抽象展示。
教育 教科书或在线课程可以对概念进行分层,让学生在详细课程与宏观摘要之间轻松切换。
任务管理 待办事项列表可以详细突出今天的任务,同时展示每周目标和整体项目的摘要。
将鱼眼镜头应用于文本的美妙之处,在于它非常自然地契合了我们理解世界的方式。我们天生就能看清一朵花的细节,同时注意到它生长的草地;能专注于一场对话,同时保持对周围房间的感知。事实和观点孤立存在时从来没有意义;只有与更广泛的上下文连接起来,它们才会获得深度与相关性。
这个概念并不新鲜——它是数据可视化等领域的基础。一个孤立的数字或许能告诉你某些信息,但真正揭示其背后故事的,是趋势、比较和关系。42 算大还是小?没有上下文,根本无法判断。上下文能把原始数据转化为理解,也能让任何事实——或者段落、答案——获得意义。
鱼眼镜头把同样的原则应用到了我们探索知识的方式上。它关注的不只是宏观全景或微小细节,而是如何在两者之间轻松穿梭。通过模拟我们处理细节与上下文的自然方式,它创造出的工具不仅能帮助我们更清晰地思考,也能让我们的思考方式更符合人性。