我们做了 Apple Intelligence 的终极形态
About
Siri 2011 年发布,到现在十五年了。模型从语音识别一路进化到今天能自主写代码、调工具、跑 Agent,但有件事其实一直没解决:AI 还是不知道你电脑上正在发生什么。
这也是我最近越来越确定的一个判断:下一代个人 AI 的瓶颈,可能已经不在模型,而在操作系统和模型之间那层一直缺失的东西。
今天的 AI,Context 基本靠人肉 ETL
仔细看现在大部分 AI 产品的交互,会发现底层逻辑没怎么变。
用户负责把网页复制进去、文件上传进去、聊天记录贴进去,再用 Prompt 把背景重新描述一遍;模型拿到一份人为整理过的 Context,开始推理。说白了,就是人肉 ETL + LLM。
MCP、Skills、Tool Calling 解决了 AI“能调用什么”的问题,但没有解决它“此刻应该看什么、为什么要调用、当前任务进行到哪”的问题。
这两个完全不是一回事。
一个 Agent 可以拥有 100 个 Tool,但如果它不知道你刚从 Excel 切到浏览器是为了核一个数字,不知道桌面上的 PDF 和飞书里刚收到的消息属于同一个任务,那这 100 个 Tool 大部分时间只是武器库。
枪很多,不知道敌人在哪。
真正难的不是读取屏幕,而是把工作现场变成状态
所以我们做 Lynx 的时候,没有把重点放在“再做一个更强的 Agent”。
我们先啃的是更底层的一层:怎么把电脑上不断变化的工作现场,变成机器可以持续理解的 Context。
这里面不只是截图。
一个窗口是什么 App、当前 Tab 是什么、用户正在操作哪个对象、文件和网页之间有没有关系、前后发生了哪些事件、哪些信息属于同一个任务,这些东西如果每次都靠截图 + OCR + VLM 重新猜,不仅贵,而且状态是断的。
屏幕是一张图,工作却是一条连续状态流。
这也是为什么很多 Computer Use Demo 看起来很惊艳,真正塞进每天八小时工作流里就开始变脆。真实电脑不是 benchmark:窗口会动、页面会刷新、文件会换版本、用户会中途插手、一个任务会跨五六个应用。
能点按钮只是执行问题。
知道为什么点这个按钮,以及点完之后世界发生了什么变化,才开始接近 Agent。
Siri 当年缺的不是语音,今天也不是
以前我们把 Siri 理解成 Voice Interface,所以这些年大家不断给它升级识别、语言理解、模型能力。
但如果往终局看,我觉得“语音助手”这个定义本身就小了。
真正的 Siri 应该更像操作系统里的一层 ambient intelligence:它不需要时时刻刻录屏监控你,但在权限允许的范围内,能够理解当前工作状态;当你说“刚才那个”“这几个一起整理一下”“按前面继续”,这些指代在系统里是有 grounding 的。
语言只是 Intent,Context 才决定这句话到底是什么意思。
没有 Context,“帮我把这个发给他”是一句废话;有了 Context,它可能已经包含当前文件、最近联系人、前序讨论和发送渠道。
同一句自然语言,信息量完全不是一个级别。
我们现在就在磨这层东西
Lynx 做的事情,本质上就是把 OS、应用、窗口、网页、文件和操作事件,先组织成一个持续变化的语义现场,再让模型和 Agent 在上面工作。
后面 Planning、Tool Calling、权限确认、执行当然都重要,但我们现在越来越觉得,Context quality 很可能直接决定 Agent ceiling。
上游看错了,后面模型再聪明都只是在一本正经地跑偏。
这也是这东西做起来最折磨人的地方:你不是接几个 API 就结束了,而是在和真实操作系统里几十年的历史包袱打架。Accessibility、浏览器、原生应用、文件系统、权限,每层都有自己的脾气。
很脏,但也很好玩。
Lynx 最近已经快到可以让更多人进来折腾的阶段了。肯定还有 bug,毕竟真实人的电脑比我们自己能构造出来的测试集野多了。
如果你想提前用,可以直接滴滴我或者评论区留言;也可以在评论区扔一个你最希望 Siri 本来就应该会、但到今天还不会干的事情。
我们拿真实世界继续测。
毕竟 Siri 的终极形态,不该只是终于能回答更多问题。它应该终于知道,你为什么会问这个问题。