全链路可观测:慢在哪一眼看见
这天把"追踪 + 日志"打通成一条贯穿前端、后端、agent 的完整链路:一次操作从界面发出、经后端、到 agent 执行、再回到画面,全程可追,配卡顿看门狗,慢在哪、卡在哪一眼可见。渲染调试工具也学会了录下初始状态,让"黑屏"这类最难缠的问题能在回放里稳定重现。
看不见的系统,管不住
当一个系统越来越复杂、越来越多的环节交给 AI 自主推进,一个根本问题就浮上来了:它内部到底在发生什么?一次操作明明发出去了,半天没反应,到底卡在前端、卡在后端、还是某个 agent 正在埋头干活?光凭表面现象,你只能猜。这一天做的,就是把整个系统从"黑箱"变成"透明箱":让一次操作的完整旅程——从你在界面上点下去、到后端处理、到 agent 一回合一回合地执行、再到结果回到画面——全程都能被追踪、被看见。这看似不增加任何新玩法,却是一个复杂系统能被长期驾驭的前提:看得见,才管得住;管得住,才敢继续放手交给它更多。可观测性是所有优化与排错的起点——你无法改善一个你看不清的东西。
一条贯穿前后端与 agent 的追踪
这天最核心的工作,是把"追踪"打通成一条真正贯穿全栈的链路。所谓追踪,就是给一次操作打上一个统一的标识,让它无论流经系统的哪一层,都带着这个标识、留下时间戳,于是事后可以把散落在各处的片段,按这个标识串成一条完整的时间线。这天做到的,是让这条标识从前端一路传递到后端、再传递到 agent 的执行里——任意一次操作,都能被还原成"它先在前端花了多久、再在后端花了多久、然后哪个 agent 接手、又花了多久"的完整轨迹。技术上的关键,是让这个追踪上下文在跨越每一层边界时都被正确地往下传,而不是在边界处断掉(那样就只能看到孤立的片段、拼不成全局)。这条贯穿全链的追踪一旦建立,"系统慢"或"系统卡"这类最含糊、最难查的抱怨,就有了一把能精确定位的尺子。
前端追踪器 + 卡顿看门狗
在这条全链追踪里,前端这一段单独加了一个浏览器侧的追踪器,专门跟住"从你在界面上发出一个动作,到它最终渲染出来"这一程。它解决的是一类很具体的困惑:有时你点了一下、敲了一段,界面却迟迟没反应——到底是请求还没发出去、是在等后端、还是前端自己在某处卡住了渲染?前端追踪器把这一程拆成可见的步骤,让你能看清究竟卡在哪一步。配套还加了一个"卡顿看门狗":它会盯着关键流程的节奏,一旦某一步迟迟不动、超出了预期时间,就立刻把这个卡顿标记出来,而不是让你对着一个一动不动的界面干等、不知道它是死了还是在忙。对一个以界面交互为核心的工具来说,"前端到底在忙什么、有没有卡住"是用户最直接、最高频的疑问;把这一程也纳入可观测,等于把追踪的触角伸到了离用户最近的地方。
后端汇集与上报 + agent 每回合纳入追踪
链路的另外两段也同步补齐。后端这边立起了一个遥测汇集入口:各处产生的追踪与日志被统一收到这里、再上报出去,并且会把前端带下来的追踪上下文继续往后传递,确保同一次操作在后端的部分,仍然挂在同一条追踪线上、不会断档。agent 这一段,则把每一回合的执行也纳入了同一条追踪——一个 agent 接手一个任务、跑了一回合,这一回合花了多久、做了什么,都会作为这条追踪上的一节被记录下来。这两段合起来,才让"全链路"名副其实:从前端的一次点击,到后端的处理,再到 agent 一回合一回合的工作,全部串在同一条线上。对一个核心体验就是"指挥一群 AI agent 干活"的平台来说,"每个 agent 这一回合到底在忙什么、慢在哪"是最该被看见的;把 agent 的执行也接进追踪,等于让 AI 的工作过程不再是一个不可窥视的黑箱。
渲染调试:录下初始状态,重现"黑屏"类问题
和"可观测"同一种精神,渲染调试工具这天也更强了一档。此前它已经能"录制一帧画面、再回放对比",但缺了一块关键拼图:初始状态。画面是从某个起点一步步画出来的,如果录制时只录了那些绘制动作、却没录下起点时各项资源的初始内容,回放就等于"从一个错误的起点重演",有些问题根本复现不出来。这天补上了这块:录帧时会把相关资源的初始状态也一并记下来,回放时把它作为"种子"注入,从完全一致的起点精确重建整帧。它对排查"画面一片黑、物体凭空消失"这类最难缠的问题尤其管用——这类问题往往就出在某个初始状态没设对,过去因为回放复现不出来而极难定位;现在黑屏能在回放里如实重现,等于把一个"偶发、抓不住"的幽灵 bug,变成了一个"稳定重现、可以反复研究并修复"的具体对象。它和当天的全链路追踪是同一回事的两面:一个让你看清"系统慢在哪",一个让你看清"画面错在哪"。
这一天意味着什么
这一天补上的,是一个走向成熟的系统必不可少的"感官"。前面的许多天,平台一直在长出新的能力——会动的角色、能编辑的场景、能生成的资产、能开源给所有人;但能力越多、越自动,"看清它内部在干什么"就越重要。一个看不见自己内部的系统,出了问题只能靠猜,慢了也不知道慢在哪,最终会因为无法诊断而失控。这天把追踪打通成贯穿前端、后端、agent 的一条线,又让渲染调试能录下初始状态、稳定重现画面问题——等于一次性给了平台两双眼睛:一双看性能与流程,一双看画面与渲染。把"系统在干什么"和"画面为什么是这样"都变得可见,意味着接下来无论是优化速度、排查故障,还是放心地把更多自主权交给 AI,都有了可靠的依据。能力让一个平台"能做什么",而可观测性决定它"能被信赖到什么程度"——这一天,补的正是后者。