Physical AI
让 AI 拿到物理世界的状态
大模型知道「钻戒」这个概念,不知道柜台上那枚此刻还在不在托盘里。 Physical AI 的瓶颈从来不在模型,在传感器能不能给出一个可计算的物理量。 RFID 是其中成本最低的一条腿,而相位是这条腿上最锋利的部分。
三种感知模态各缺什么
| 模态 | 物品级 ID | 遮挡 | 光照 | 成本结构 | 珠宝场景的死穴 |
|---|---|---|---|---|---|
| 视觉 | 物品级 ID | 不可穿遮挡 | 依赖光照 | 摄像头便宜,算力贵 | 分不出两枚外观相同的素金戒 |
| RFID 相位 | EPC 唯一 ID | 可穿遮挡 | 无光可读 | 标签几分钱 | 能分 ID,还能算位置与位移 |
| 力 / 触觉 | 无 | 需接触 | 不依赖 | 传感器昂贵 | 只有抓取时才有效 |
视觉的短板不是精度,是它没有物品级 ID——两枚同款素金戒在像素上完全相同。 RFID 的短板正好相反:它能分 ID,却长期只用了一个最粗糙的信号(RSSI)。
相位:把「读到了」变成「在不在原位」
往返相位 φ = 4πd / λ + φ₀。915 MHz 下 λ ≈ 32.8 cm,于是 距离每变 1 cm,相位变约 22°。 这个灵敏度是 RSSI 给不了的——RSSI 是标量,相位是几何。
代价是相位以 λ/2(16.4 cm)为周期回卷,单点快照测不了绝对距离。 但只要让天线沿柜台平移采样,φ(x) 就是一条由几何唯一确定的轨迹——序列的形状本身就成了判据。
而真实硬件还要再打一次折:读写器只判断 I 与 Q 是否同号、不判象限, 相位被折叠到 0–180°,歧义周期从 λ/2 减半到 λ/4(8.2 cm)。 灵敏度没变,仍是 22°/cm——变的是回卷更密,对序列解卷绕的依赖更重。
珠宝托盘 · 三件货的相位剖面
λ = 32.8 cm · 周期 λ/2 = 16.4 cm入库时把每件货的 φ(x) 标定存下来,盘点时复扫比对。 静止物的相位轨迹由几何唯一决定,残差小即判在位——比单点 RSSI 强在它是序列而非标量。
论文里的相位 vs 读写器给你的相位
同一件货(A)、同一个公式,只改读出方式。上下两条曲线的差别就是实验室与现场的差。
实测剖面与入库标定剖面重合,残差 0.05 rad。
与 A 相距 4 cm(小于折叠周期 λ/4 = 8.2 cm 的一半),相位可分开,RSSI 不能。
被试戴后归位偏移,实测剖面整体右移,残差 1.87 rad。
同一组几何,两种信号:为什么必须是相位
天线扫过 x = 0 时,A(−8 cm)与 C(−4 cm)的接收差异
RSSI 差 0.16 dB,低于读写器 0.5 dB 的分辨门限——两件货在 RSSI 上完全重合;相位差 0.257 rad(14.7°),约为实测复现性 ±5° 的 3 倍。注意这是展开后的值:主流读写器链路把相位折叠到 0–180°,14.7° 的间隔在折叠域内依然分辨得开。
四类相位判据
在位判定
残差 RMS < 0.15 rad把入库时标定的相位剖面 φ(x) 存下来,盘点时复扫一次比对。静止物的相位轨迹由几何唯一决定,残差 RMS 小于阈值即判在位——比单点 RSSI 强在它是序列而非标量。
亚波长分辨
可分辨下限 ≈ 1 cm远场无法分辨 λ/2 以内的两个目标,但相位对距离的灵敏度是 4π/λ。相邻 4 cm 的两件货,RSSI 差 0.16 dB 读不出来,相位差 14.7° 一眼分开。
移动检测
位移灵敏度 ≈ λ/50天线静止、标签移动时,相位随 2d/λ 线性漂移(Doppler 符号可判进出)。柜台场景下这直接区分「店员整理」与「顾客取走」。
金属失谐补偿
幅度失真下仍可用金、银、铂是导体,标签贴附即失谐,谐振点偏移导致读距骤降。相位剖面不受幅度影响——这正是珠宝这种最差射频环境里相位比 RSSI 更可靠的物理原因。
工程现实:相位断在三层,断点常常不在你以为的那一层
算法再漂亮,硬件不吐相位就是论文。但「不吐」是三种完全不同的不吐—— 芯片做不到、固件没开放、场景用不了。解法不同,代价也不同。
| 环节 | 层 | 相位可得 | 说明 |
|---|---|---|---|
| 射频平台(芯片 / 模块) | 芯片/模块 | 是 | 主流 UHF 射频平台在硬件层具备相位测量能力;个别衍生型号存在例外——「平台名」不等于「能力承诺」,不能按平台名推断某款具体机器一定吐相位。 |
| 部分固件 / SDK 封装 | SDK 暴露 | 否 | 只封装 EPC、RSSI 等盘点必需字段,相位未开放。这是封装取舍,不是射频平台不具备——同一模块换用完整开放的 API 就能读到。选型时该问的是「固件/SDK 是否开放 phase」,而不是「这台机器有没有相位」。 |
| 完整开放的读写器 API | SDK 暴露 | 是 | 相位随标签响应一并上报。注意多数实现的量程是 0–180° 而非 0–360°——拿到手就带着折叠,歧义周期直接减半。 |
| 手持盘点(姿态抖动 + 人体耦合) | 场景可用 | 否 | 绝对相位不可信:手抖 1 cm 就是 22°,人体还是 915 MHz 的强反射体。但同帧多标签的相位差能消掉共模抖动——手持只能走差分量,不能走绝对量。 |
| 固定天线阵列(柜台上方) | 场景可用 | 是 | 天线—标签几何在采样窗口内恒定,φ(x) 剖面可复现,适合绝对相位与入库标定比对。 |
就算 SDK 吐了 phase,也不代表这个数能用
手持机是按「解码」优化的,不是按「测相位」优化的——功耗和成本都压在前者。 拿到字段只是第一步,接收链路还得先过这几道门槛。
- I/Q 不饱和 — 手持机常用高增益 + 低分辨率 ADC 为解码优化,一旦饱和,相位信息直接抹掉
- 线性接收,SNR > 20 dB — 非线性会改写相位,且这种误差无法后处理补偿
- I/Q 共用线性相位滤波 — 两路滤波特性不一致会凭空引入相移
- I/Q 增益与相位不平衡需出厂标定 — 20° 的相位不平衡就足以让 RSSI-距离曲线出现 λ/4 间隔的波纹
合起来看:手持机的射频平台大多具备相位能力,断的往往是 SDK 封装层——只把 EPC 和 rssi 包出来,相位没开放。所以「手持跑不了相位」是个错误的结论, 真问题是「这台机器的固件/SDK 有没有把 phase 开放出来」,这是选型时该问厂商的一句话。 打通之后也别急着做绝对测距——手抖 1 cm 就是 22°,人体还是 915 MHz 的强反射体, 手持只能走同帧多标签的差分相位,把共模抖动减掉。 柜台上方固定天线阵列,才是绝对相位剖面的场景。
为什么把它叫 Physical AI
因为这一层做的事,和 LLM 那一层完全互补。 LLM 处理的是人类已经写成文字的知识;相位处理的是从来没有被任何人记录过的物理事实—— 那枚戒指此刻在托盘的哪个位置、有没有被移动过 6 cm。
前者有海量训练数据,后者一条都没有,只能靠传感器现场产生。 这就是为什么物品状态层值得单独做:它不是模型的延伸,是数据的缺口。