// CASE_FILE > GLASSBOX

AI / 智能体 · 可观测性2026

Glassbox

看不见的智能体无从改进。我构建了一个本地、只读的观察器,把一份 Claude Code 会话记录转化为一份六指标的行为报告。

6
行为指标
1
自包含报告
0
网络调用
github.com/HUMBLEF0OL/glassboxFEED//LIVE
$ npx glassbox --latest
[ok] transcript parsed
[ok] 6 metrics scored
network calls ........ 0
report ............... glassbox.html
status: OBSERVED
$

// 01 > CONTEXT

Glassbox 读取一份 Claude Code JSONL 会话记录,渲染出一份自包含的 HTML 报告,内含六个行为指标、一条会话时间线和一张框架健康度记分卡。它不发起任何网络调用,也从不控制智能体。

// 02 > THE_PROBLEM

智能体会话是不透明的:当一次运行出岔子时,没有可读的记录说明智能体到底做了什么、为什么这么做。

原始会话记录是一整面 JSONL 的墙。此前无法看出智能体是否搜索过度、是否过早宣告胜利、是否跳过了验证、是否陷入循环 —— 而正是这些模式区分了健康的运行和浪费的运行。

之前

会话不透明 · 只有原始 JSONL · 没有行为信号

// 03 > APPROACH

我构建了一个零依赖、只读的观察器,为六种行为评分并渲染一份可移植的 HTML 报告,并刻意在它自身的框架下构建它,以诠释它所度量的内容。

六个行为指标

Grep 与语义搜索之比、过早宣告胜利检测、验证密度、范围越界、连续性以及循环检测。

构造即安全

只读且离线:它自动发现最新的会话记录,对机密信息进行脱敏,且从不控制智能体。

Node.jsJavaScriptESM

// 04 > THE_RESULT

一份杂乱的会话记录变成一份自包含的 HTML 报告,为六种行为评分,零网络调用,并对机密信息完全脱敏。

之前

  • 会话难以检视
  • 没有行为指标
  • 手动阅读会话记录

之后

  • 6 指标记分卡 + 时间线
  • 0 次网络调用,机密已脱敏
  • 两次会话对比
如果你无法度量一个智能体的行为,你就无法修正它。Glassbox 始终保持只读且离线,因此观察从不改变运行本身。
AAmit RanaAuthor & Maintainer, Glassbox

遇到了类似的问题?

预约 20 分钟通话