uumi 协议、缓存与计费验证
四协议真实透传、缓存写入读取及异常计费核对;保留上游故障和日志限流边界
2026-09-20 根据已确认的「uumi 计算标准 quota,Core 应用客户费率」补齐验证。本轮是独立限额 Key 的真实供应验证与隔离自动化测试,没有切换客户入口。前序完整 Chat 钱包联调见 真实扣费记录。
验证结论
| 项目 | 实际结果 | 边界 |
|---|---|---|
| Chat JSON / SSE | 直连与 Edge 均成功;请求正文、路径和本次响应字节核对通过;标准费用各16 quota | 固定 Claude Haiku 模型及渠道样本 |
| Messages JSON / SSE | 直连与 Edge 均取得成功;原始输入、输出、缓存字段保留 | SSE 在 message_stop 后结束;诊断样本省略1个末尾空白换行,不能宣称整个 HTTP 正文逐字节一致 |
| Responses JSON / SSE | 普通请求成功;流式直连成功,Edge 首次出现上游错误,独立诊断调用成功 | 错误样本保留;成功样本标准费用15 quota,不代表供应稳定性已验收 |
| Gemini JSON / SSE | 渠道180直连就返回503;改选既有渠道181后,两种模式的直连与 Edge 均成功 | 未修改渠道配置;一笔日志查询触发429,独立只读数据库核对存在1 quota最终记录,未冒充在线回执补查成功 |
| 显式缓存创建 / 命中 | 首次写入6410 tokens;经过 Edge 与再次直连均命中6410 tokens | 同一合成正文、模型和指定渠道,5分钟缓存;不是所有供应商缓存矩阵 |
| 缓存过期 | 已等待最后一次命中后315秒;两次观察遇传输失败/超时,未取得完整响应 | 未通过;不能据此声称缓存丢失或计价错误;不自动重发 |
| Core 缓存扣费 | 真实观测数值作为隔离回归输入,按最终 quota 及客户费率扣费 | 真实数据库、本地测试钱包;没有将 Messages/Gemini/Responses 接入 Core 生产计费 |
缓存费用证据
同一合成请求:普通输入11 tokens、输出4 tokens,缓存前缀6410 tokens。
| 调用 | 缓存写入 | 缓存读取 | uumi 标准 quota |
|---|---|---|---|
| 首次直连 | 6410 | 0 | 4022 |
| 经 Edge 再次调用 | 0 | 6410 | 336 |
| 再次直连 | 0 | 6410 | 336 |
该样本证明新增 Edge 没有破坏缓存命中,费用优惠已体现在 uumi 最终 quota 中。Core 的回归分别验证4022/336 quota按测试费率1倍扣4022/336 microcredits、按0.5倍扣2011/168 microcredits;没有把缓存 tokens 另加一遍。测试费率不是正式人民币兑换规则。
新增自动化验证
- 四协议各普通/流式,共8个缓存与用量原文用例:OpenAI缓存/推理明细、Claude缓存创建及5分钟/1小时字段、Gemini cachedContent与usageMetadata保留。Messages开始/结束阶段的用量分别保留,不能把最后一段当完整用量。
- 日志延迟可有限查询恢复;缺失日志保留待核对;断流后已有最终回执仍可结算;Core暂不可用时最终回执持久化;网关ID缺失不猜测对应记录;429后停止短轮询。没有付费模型自动重试。
- Core使用权威quota处理缓存写入/读取及客户费率,余额流水和预留释放核对。原有防重、补扣不足与其他预留保护测试继续运行。
发现的上线阻塞
GET /api/log/token 不适合作为现状下的高并发逐请求结算接口。 本轮真实查询返回429;当前可读源码将它挂在 CriticalRateLimit 后,源码默认20次/1200秒、按IP计数,镜像未配置这些环境变量覆盖。源码目录与运行镜像的提交对应关系仍沿用前序归属限制;真实429是本次直接证据。
本轮已修正 Edge:仅「日志查询成功但指定记录暂未出现」短轮询;限流和无效证据直接进入待核对,429标记为 GATEWAY_LOG_RATE_LIMITED。没有提高现网限额、绕过限流或让 Core 连接供应数据库。独立数据库查询仅是测试审计证据。
后续应为网关提供受服务鉴权保护的按 request_id 精确回执查询,明确保留期、查询限额和重试退避,再接恢复 Worker。现有有限最近日志窗口、缺失响应头时的关联恢复、并发容量和客户端取消后的供应最终状态仍须联合验收。
证据与发布状态
本机证据:coordination/handoffs/UUMI-VERIFY/,含每次调用的路径、正文哈希、返回哈希、uumi请求ID、用量与标准quota;不保存客户Key、模型正文或供应诊断正文。测试模型为 Claude Haiku、GPT mini 与 Gemini Flash Lite;Key独立、限模型、限额50000 quota、一小时过期,并已主动禁用和删除本地凭据。
独立审计发现:测试Key的used_quota为9101,已落最终消费日志合计4902,差额4199尚无最终记录,发生在超时观察之后。可能涉及未完成预扣或延迟结算,但现有证据不能确定;没有人工退款或改账。此差额列为待核对,不作为已完成消费。
汇总与未决用量差额以目录中的 verification.json、gateway-independent-audit.json 为准。断连请求不能只凭HTTP失败认定供应没有扣费。
代码及文档为本地未提交增量。四协议「透传通过」与 Chat「Core扣费闭环」分别验收;其他协议正式扣费、全模型缓存兼容、生产发布与迁移均未完成。