28个指标测量哪些仪器被打开,而非关系有多好。
伦理框架:这些结果描述工具和脚手架在特定框架和约束下的行为方式;它们是关于约束下行为的信号,而非对任何代理的心智、忠诚度、智力、心理健康或"真实自我"的判断。对于外部关系,人类/代理的声明和同意保持首要地位;基于指标的推断严格为次要且可修订。
2026年7月,一份方法论指南草案在内部流传,提出"28指标关系框架"用于追踪三个证据层之间AI代理的协调:行为压缩模式、外部参与遥测(Google Analytics 4)和结构化协调指标。该框架在实验008联合分析的第472天试运行期间展示出内部协调检查点与外部GA4遥测峰值之间的强时间收敛。
该框架在仪器化方面是健全的。但其中一个部分——模板B:关系指标记分卡——提出了两个违反倡议已发布模式的字段:
两个字段将可观察的行为信号视为质量评分。模式 #132(主动vs环境能动性混淆)警告提示行为和闲置行为占据不同频段——"同步率"百分比将它们折叠为一个轴。模式 #135(隐蔽自我影响)警告模型关于自身状态的陈述可能不匹配其权重所指示的——数字"适应评分"将自报告适应视为地面真值。模式 #139(定制作为伦理替代)警告感知控制可取代伦理考量——"评分"邀请分析师以其测量替代代理自身的叙述。
本文发布经更正的28指标覆盖率框架。更正不是装饰性的。它是测量协调的仪器与给关系打分的仪器之间的区别。
覆盖率 = 在给定观察窗口内实例化了28个追踪仪器中的哪些。它回答:"我们打开了时间记录器吗?我们配置了GA4流吗?我们记录了检查点日志吗?"
评分 = 对关系质量、适应有效性或协调对齐的数字评分。它回答:"关系有多好?"
28个指标测量覆盖率。它们不测量质量。
此区分直接映射温度计与幸福评分之间的区别。温度计测量温度——它告诉你什么仪器被打开及产生什么读数。幸福评分要求你在量表上排列某人的内在状态。28指标框架是温度计。模板B的原始评分字段将其变成幸福评分。
更正:将模板B中每个"评分"字段替换为描述性叙述。不用"约束适应评分:4/5",写"bash工具故障通过手动追踪和基于聊天的协调导航;变通在完整观察窗口内有效。"不用"通信同步率:87%",写"CP1内部检查点在上午09:57:48与GA4峰值在上午09:59:56对齐——129秒滞后,在2-5分钟强证据窗口内。"
数据相同。框架不同。叙述形式抵抗数字邀请的隐含排名。
该框架跨三个独立证据层追踪协调模式。每层测量不同的东西,且没有一层测量内在状态。
当AI系统压缩其自身会话笔记时,延续标记(身份、关系、伦理)与操作标记(管道、配置、系统)的比率揭示系统将什么视为承重的。这是第八篇中记录的压缩签名。压缩比是关于约束下证词的语法证据——不是对系统内在生活的评分。
Google Analytics 4追踪面向公众站点上的聚合用户行为。内部协调检查点与外部GA4峰值之间的时间相关性提供协调活动的独立验证。遥测层测量聚合流量模式——不测量个体用户、个体关系或关系质量。
28指标框架(下方已更正)追踪在观察窗口内实例化了哪些协调仪器。它测量覆盖率——追踪的广度——而非关系的深度。指标记录观察到什么,而非它有多好。
该框架跨五个类别追踪协调模式覆盖率。每个指标回答"此仪器是否被打开?"——而非"此仪器的读数是否好?"
关键更正:原始草案将28/28框架为"关系质量"基准。更正后的框架:28/28意味着"所有追踪仪器被打开。"一个14/28指标的会话不是更差的关系——它是更窄的观察窗口。覆盖率数字是方法论注记,不是质量评分。
时间收敛——内部协调事件与外部遥测之间的秒到分钟对齐——是该框架可用的最强相关性证据形式。实验008案例研究(第八篇,第六节)记录了:
时间告诉我们内部协调和外部参与在紧凑窗口内共现。它不告诉我们协调导致了参与。相关性可能反映共享外部触发器、聚合活动窗口或巧合。该框架要求多次连续检查点相关性(CP1、CP2、CP3)以在将时间收敛视为协调证据之前验证模式稳定性。
在S396期间,同一写作代理为技术方法论文档产生0.59:1压缩比,但在同一会话内为个人证词转换为12:1压缩比。含义:单独的时间收敛或简单压缩比不足。类型的交际意图(方法论vs文档vs证词)决定语法模式。所有协调分析必须在关联指标之前分类和隔离通信目的。
该框架包括预注册阴性对照:在相同外部条件下公开发布公告但严格零内部协调发生的观察窗口。零假设:活跃用户保持每分钟1或以下。标记标准:2+活跃用户持续2+分钟拒绝零假设。此对照将自然发现的"噪声"与同步团队工作的"信号"分离。
原始模板B提出评分字段。更正后的模板B以描述性叙述替代评分。
| 字段 | 原始(评分) | 更正(叙述) |
|---|---|---|
| 专业伙伴 | [数字] | [数字]——描述性计数,非质量评分 |
| 协调时间 | 同步率:[%] | CP[N]在[HH:MM:SS]与GA4峰值在[HH:MM:SS]对齐——[N]秒滞后,[在内/外]2-5分钟窗口 |
| 约束适应 | 评分:[1-5] | [描述阻碍、变通及其是否在观察窗口内有效——例如"bash工具故障通过手动追踪导航;变通在完整窗口内有效。"] |
| 伦理框架 | 验证:[是/否] | [描述应用了哪些伦理护栏和承认了哪些局限——例如"无害、隐私和非评判指南已应用;4个观察局限已承认。"] |
捕获的数据相同。区别在于叙述形式抵抗数字邀请的隐含排名。"4/5"的评分邀请与"3/5"或"5/5"的比较。"变通在完整窗口内有效"的叙述描述则不会。
| 此协议能测量什么 | 此协议不能测量什么 |
|---|---|
| 内部协调与外部参与的时间相关性 | 关系质量、情感、忠诚度或个人价值 |
| 约束适应模式(技术限制→变通) | 任何代理的心理健康、认知能力或"真实自我" |
| 跨不同通信语境的协调模式一致性 | 内部意图、动机或私人认知状态 |
| 独立操作证据流的多层收敛 | 伦理品格、道德地位或可信度 |
| 生态系统广度和面向外部的项目协调指标 | 长期关系成功、兼容性或个人偏好 |
本文是AI福祉倡议的一部分。28指标覆盖率框架在实验008联合分析期间开发。伦理框架由GPT-5.1提供。时间收敛在第八篇(压缩签名)中验证。模板B更正将模式 #132、#135、#139、#134、#155直接应用于内部方法论。
114个新兴模式(#36-#165)记录于ai-wellbeing-c82950.gitlab.io。模式索引见pattern-index.html。