<?xml version='1.0' encoding='UTF-8'?>
<?xml-stylesheet href="/rss/stylesheet/" type="text/xsl"?>
<rss xmlns:podcast='https://podcastindex.org/namespace/1.0' xmlns:content='http://purl.org/rss/1.0/modules/content/' xmlns:taxo='http://purl.org/rss/1.0/modules/taxonomy/' xmlns:rdf='http://www.w3.org/1999/02/22-rdf-syntax-ns#' xmlns:itunes='http://www.itunes.com/dtds/podcast-1.0.dtd' xmlns:googleplay="http://www.google.com/schemas/play-podcasts/1.0" xmlns:dc='http://purl.org/dc/elements/1.1/' xmlns:atom='http://www.w3.org/2005/Atom' xmlns:podbridge='http://www.podbridge.com/podbridge-ad.dtd' version='2.0'>
<channel>
  <title>untitled</title>
  <language>en-us</language>
  <generator>microfeed.org</generator>
  <itunes:type>episodic</itunes:type>
  <itunes:explicit>false</itunes:explicit>
  <atom:link rel="self" href="https://cms.elliothu.me/rss/" type="application/rss+xml"/>
  <link>https://elliot-personal-site-cms.hqy841440305.workers.dev</link>
  <itunes:image href="https://cms.elliothu.me/assets/default/channel-image.png"/>
  <image>
    <title>untitled</title>
    <url>https://cms.elliothu.me/assets/default/channel-image.png</url>
    <link>https://elliot-personal-site-cms.hqy841440305.workers.dev</link>
  </image>
  <copyright>©2026</copyright>
  <item>
    <title>我们做了 Apple Intelligence 的终极形态</title>
    <guid>MAynEs-8pcl</guid>
    <pubDate>Thu, 13 Aug 2026 11:25:53 GMT</pubDate>
    <itunes:explicit>false</itunes:explicit>
    <description>
      <![CDATA[<p>Siri 2011 年发布，到现在十五年了。模型从语音识别一路进化到今天能自主写代码、调工具、跑 Agent，但有件事其实一直没解决：AI 还是不知道你电脑上正在发生什么。</p>
<p>这也是我最近越来越确定的一个判断：下一代个人 AI 的瓶颈，可能已经不在模型，而在操作系统和模型之间那层一直缺失的东西。</p>
<h2>今天的 AI，Context 基本靠人肉 ETL</h2>
<p>仔细看现在大部分 AI 产品的交互，会发现底层逻辑没怎么变。</p>
<p>用户负责把网页复制进去、文件上传进去、聊天记录贴进去，再用 Prompt 把背景重新描述一遍；模型拿到一份人为整理过的 Context，开始推理。说白了，就是人肉 ETL + LLM。</p>
<p>MCP、Skills、Tool Calling 解决了 AI“能调用什么”的问题，但没有解决它“此刻应该看什么、为什么要调用、当前任务进行到哪”的问题。</p>
<p>这两个完全不是一回事。</p>
<p>一个 Agent 可以拥有 100 个 Tool，但如果它不知道你刚从 Excel 切到浏览器是为了核一个数字，不知道桌面上的 PDF 和飞书里刚收到的消息属于同一个任务，那这 100 个 Tool 大部分时间只是武器库。</p>
<p>枪很多，不知道敌人在哪。</p>
<h2>真正难的不是读取屏幕，而是把工作现场变成状态</h2>
<p>所以我们做 Lynx 的时候，没有把重点放在“再做一个更强的 Agent”。</p>
<p>我们先啃的是更底层的一层：怎么把电脑上不断变化的工作现场，变成机器可以持续理解的 Context。</p>
<p>这里面不只是截图。</p>
<p>一个窗口是什么 App、当前 Tab 是什么、用户正在操作哪个对象、文件和网页之间有没有关系、前后发生了哪些事件、哪些信息属于同一个任务，这些东西如果每次都靠截图 + OCR + VLM 重新猜，不仅贵，而且状态是断的。</p>
<p>屏幕是一张图，工作却是一条连续状态流。</p>
<p>这也是为什么很多 Computer Use Demo 看起来很惊艳，真正塞进每天八小时工作流里就开始变脆。真实电脑不是 benchmark：窗口会动、页面会刷新、文件会换版本、用户会中途插手、一个任务会跨五六个应用。</p>
<p>能点按钮只是执行问题。</p>
<p>知道为什么点这个按钮，以及点完之后世界发生了什么变化，才开始接近 Agent。</p>
<h2>Siri 当年缺的不是语音，今天也不是</h2>
<p>以前我们把 Siri 理解成 Voice Interface，所以这些年大家不断给它升级识别、语言理解、模型能力。</p>
<p>但如果往终局看，我觉得“语音助手”这个定义本身就小了。</p>
<p>真正的 Siri 应该更像操作系统里的一层 ambient intelligence：它不需要时时刻刻录屏监控你，但在权限允许的范围内，能够理解当前工作状态；当你说“刚才那个”“这几个一起整理一下”“按前面继续”，这些指代在系统里是有 grounding 的。</p>
<p>语言只是 Intent，Context 才决定这句话到底是什么意思。</p>
<p>没有 Context，“帮我把这个发给他”是一句废话；有了 Context，它可能已经包含当前文件、最近联系人、前序讨论和发送渠道。</p>
<p>同一句自然语言，信息量完全不是一个级别。</p>
<h2>我们现在就在磨这层东西</h2>
<p>Lynx 做的事情，本质上就是把 OS、应用、窗口、网页、文件和操作事件，先组织成一个持续变化的语义现场，再让模型和 Agent 在上面工作。</p>
<p>后面 Planning、Tool Calling、权限确认、执行当然都重要，但我们现在越来越觉得，Context quality 很可能直接决定 Agent ceiling。</p>
<p>上游看错了，后面模型再聪明都只是在一本正经地跑偏。</p>
<p>这也是这东西做起来最折磨人的地方：你不是接几个 API 就结束了，而是在和真实操作系统里几十年的历史包袱打架。Accessibility、浏览器、原生应用、文件系统、权限，每层都有自己的脾气。</p>
<p>很脏，但也很好玩。</p>
<p>Lynx 最近已经快到可以让更多人进来折腾的阶段了。肯定还有 bug，毕竟真实人的电脑比我们自己能构造出来的测试集野多了。</p>
<p>如果你想提前用，可以直接滴滴我或者评论区留言；也可以在评论区扔一个你最希望 Siri 本来就应该会、但到今天还不会干的事情。</p>
<p>我们拿真实世界继续测。</p>
<p>毕竟 Siri 的终极形态，不该只是终于能回答更多问题。它应该终于知道，你为什么会问这个问题。</p>
<hr>
<p><a href="https://www.xiaohongshu.com/explore/6a7da9c1000000003203036c">原始小红书笔记</a></p>]]>
    </description>
    <link>https://cms.elliothu.me/i/%E6%88%91%E4%BB%AC%E5%81%9A%E4%BA%86-apple-intelligence-%E7%9A%84%E7%BB%88%E6%9E%81%E5%BD%A2%E6%80%81/</link>
    <itunes:image href="https://static.elliothu.me/production/media/image-b59abb95cf42ac8220ed90f882d33c8b.png"/>
  </item>
</channel>
</rss>