YUKI'S GALLERY

科技文艺复兴的探索者

毕业于北京大学、持续押注 AI,在技术快速变化的早期阶段,将前沿能力转化成产品价值

Bain商业尽调组 · 实习咨询顾问(转正)

OPPOCEO 办公室 · 战略运营助理

OPPO影像创作组 · AI 产品经理

02 / 思考

思考

AI 洞察

从 LLM OS 到 Agent OS:算法与工程的黄金分工

#随手发一点最近的学习笔记

从LLM OS到AgentOS,普遍的共识是AI会诞生新的操作系统,但采用何种方式并没有结论。最近看了OpenAI和Elevenlabs发布的可视化流程编辑器,flowith也算上吧,感觉AgentOS的大厦有建脚手架了。

今天早上,我回看过去写过的所有prompt,突发奇想去问DeepSeek,prompt的黄金标准是什么?“角色-任务-约束”,这并不稀奇。
但它其中一点提到:“把个性化的内容拆分出来,实现可复用性”。
这个点一下就让我联想起来了。从Manus CTO之前讲上下文的历史消息和缓存中提到的节省KV cache的方式,到Agent本身被设计用于执行高度重复性的任务,似乎我们都在不自觉地追求流程的“可复用性”与“标准化”,这就有趣了

从prompt->context的过程,能不能理解成和LLM OS到近期Agent OS的讨论是同一个序列演进?

一开始是基础的续写与问答(GPT-2/3),后来发展到成对的QA,再到工具调用型问答,接着 DeepSeek-R1 融合了思维链与工具调用的多步推理,形成 ReAct 这类回合制的工作流。
在资源无限的情况下,我当然是“苦涩的教训”,但是救命现在的token都好贵啊。放开手让 AI 做一切固然理想,但现实中,把能规则化的部分工程化,或许才是 Agent 真正走向实用的开始。随着模型能力增强,复杂性在转移。我们用Bash替代一堆定制化工具;通过Sub-Agent机制将复杂任务模块化、隔离化;当上下文过长时,用自动压缩(工程手段)来牺牲部分细节以保全系统运行。这里哲学可能是:将不确定性封装在算法的“盒子”里,然后用工程手段去管理这些盒子。

核心:工程与算法的黄金分工,同一个任务可能有确定的场景和不确定的场景,举个例子送外卖送到大小区你能轻松找到电梯,送到犄角旮旯巷子口你就得试错

工程解决确定性部分:用正则、黑白名单、Hook钩子处理工具调用的安全检查、信息匿名化。这些是“if-else”能覆盖的领域,精准、廉价、可靠。
算法解决不确定性部分:需要理解、推理、创造的开放性任务,才动用LLM这个“重武器”。Prompt的“角色-任务-约束”黄金法则,本质上是将非结构化的创意工作,结构化成一个可工程化调试的“配置参数”。

与其完全依赖模型的“自觉”,不要总是幻想能驯服一匹脱缰的野马,不如用规则和流程去约束任务执行——就像不是所有工作都需要“985学生”,有些标准化动作交给专业模块更稳定高效。

AI 洞察

影像、记忆与压缩:从照片到“时空快照”

缘由是在普洱的最后一天:我身心放空在咖啡店呆了一个下午,想着旅行结束后该分享什么,意识到,我挑选的每一张照片,其实都远不止是照片本身——它更像一个hook(引子),或者说【时空快照】,一个横截面。背后牵连着一整套由体验、情绪和概念组成的网络

回来我就开始想几个问题:

  • 旅行对一个人来说,到底意味着什么?
  • 大家在旅途中最常拍下的,是什么内容?
  • 为什么有人会沉迷做手帐?这种大规模的记录,不是挺反直觉的吗?
  • 究竟什么样的瞬间,才值得被刻意记录和未来反复回忆?
  • 当越来越多人成为个人IP或独立开发者,他们生活的其他部分去了哪里?
  • 当时间飞逝而又无人分享悲喜时,人们是否需要一种带点仪式感的方式,来提醒自己仍在“活着,并有意义地生活着”?

和导师交流,补充了【信息压缩】这个词,就像《我看见的世界》里李飞飞在书中解释,ImageNet 之所以设定为约3万个参数,是为了对应人类语言中的基础概念数量。这揭示了一个关键:图像的层次和理解,往往是由它背后的词语和概念决定的。

那么,如果文字和图像之间存在这种深刻的联系,而文字可以拆解成一个个token(语义单元),图像又能拆解成什么呢?
我首先想到了手帐里的贴纸。一张图片的信息密度其实分布不均,大部分区域可能是杂乱无章的背景噪音。这让我想起试用CapWords时的体验:为了让识别出的主体更突出,我会主动选择屏蔽掉凌乱的背景。贴纸,就像是一种对复杂图像的提炼和压缩。或者说,贴纸化的过程,也会进一步塑造人的行为,去做减法。
但这就引出了两个问题:

  1. 贴纸作为一种压缩形式,它足够“小”、足够抽象吗?
  2. 作为唤醒记忆的“钩子”(hook),它的信息量又足够“大”吗?

我暂且假设它压缩得足够好了。那么,紧接着的核心问题是:记忆本身是由什么构成的?为什么需要hook的触发?

为此,我去翻了诺奖得主的《追寻记忆的痕迹》,里面讨论太多突触和电位的内容让我想起生物竞赛痛苦的时光。唯一记住的是,长时记忆与空间记忆在脑区中有密切联系,能为每一次体验生成两条坐标系——时间线(时间戳)与空间中(位置/场景)。多感官信息先在各自初级皮层编码,再通过海马体及高阶皮层整合成情境-时间捆绑的记忆痕迹,确保快速调用/关联。大脑并不会为“看见”保留一个纯粹的“照片”,视觉信息与声音、气味、动作等被“捆绑”成多维特征,由不同脑区用各自坐标系进行描述。当哪一天遇到hook时,一次回忆触发核心记忆中的少数关键突触,随即在皮层网络内扩散,系统会用周边神经元填补细节、删改错误,所以记忆也是找到关键零散的元素后,重建。所以记住核心的信息,注意力丢失的部分都会被选择性重建,符合vibe(氛围)地重建

贴纸这种形式,或许压缩得还不够极致。最近有看到另一套更标准可复制的分类方式,但想得很粗糙,先不分享了。总结一下,林林总总的文字,就是关于文字-图片的映射,以及记忆-时空的关联

北大故事

选好人生的 Beta,做好人生的 Alpha

北大故事

光华故事集:须信百年俱是梦,天地阔,且徜徉

人大故事

尘埃落定:我知道我可以永远相信自己

人大故事

“一二·九”的陈年幕后日记

人大故事

放弃的借口千千万万,坚持只需一个喜欢

03 / INDEX

MORE TO EXPLORE

四个项目,七篇思考。记录产品判断,也记录选择如何发生。

BACK TO TOP