成本跟踪
CubePlex 会跟踪整个组织的 LLM token 用量,帮助你监控负载与支出。用量仪表板位于 Admin > Insights(/admin/insights;/admin/cost 会重定向到此处)。
跟踪内容
通过 CubePlex 发起的每次 LLM 调用都会记录:
- 输入 token——发送给模型的 token 数量(提示词、系统指令、工具结果等)。
- 输出 token——模型在响应中生成的 token 数量。
- 缓存读取 / 缓存写入 token——从提示词缓存中读取或写入提示词缓存的 token,按各自费率计费(通常远低于新的输入 token)。
- 提供商和模型——处理该调用的提供商和模型。
- 时间戳——调用的开始和结束时间。
每次调用还会记录每个模型的价格费率(输入、输出、缓存读取和缓存写入),并将其作为调用时的快照保存;因此,即使之后在模型管理中更改模型费率,历史成本仍保持准确。
成本跟踪还会记录沙箱计算事件,因此汇总数据不仅反映 LLM token 支出。
用量仪表板
仪表板默认以 token 为主要指标,这样在尚未配置模型价格时(否则成本会显示为 $0)仍然有用。使用顶栏的 Token | 成本 切换可在配置价格后查看美元成本。浏览器会记住你上次的选择。
主指标
| 模式 | KPI 与图表 | 何时使用 |
|---|---|---|
| Token(默认) | 总/输入/输出 token、平均 token/次、按 token 排序的堆叠序列 | 始终有意义;无需定价 |
| 成本 | 总成本、平均 $/次、按成本排序的序列 | 已在模型管理中设置价格后 |
若切换到 成本 时总成本为 $0 但 token 非零,页面会显示简短提示并链到模型管理。
随时间变化的用量 / 支出
可按每日或每周粒度查看的时间序列图,并可按工作区、模型或用户拆分。Token 模式下纵轴为 token 总量;成本模式下为美元。用它发现趋势——例如新增成员后的用量增长、大批量任务峰值,或换模型带来的影响。
细分
除了全组织汇总外,仪表板还会按多种方式细分所选时段:
- 按模型——哪些模型贡献了最多流量(或支出)。
- 按工作区——哪些团队或项目最忙。
- 按用户——每个人的用量。
- 缓存效率——基于 token 字段的命中率(两种模式下均为 token 口径)。
每一行会显示输入/输出(及适用时的缓存)token、调用次数,以及当前主指标下的 token 合计或成本。
汇总 KPI 使用所选日期范围内的全组织合计。工作区/模型筛选目前主要作用于时间序列图表。汇总侧筛选对齐是已知后续项。
导出
你可以将原始成本数据导出为 CSV——可导出整个组织,也可导出单个工作区——以便在电子表格中分析或导入自己的报表系统。
截取内容: Admin > Insights 仪表板,含 Token | 成本切换、token(或成本)KPI、堆叠图与细分表。
资源: /img/admin/cost-dashboard.png
成本管理建议
- 设置准确的成本费率。 确保模型管理中的输入和输出 token 费率反映实际的提供商定价。未配置费率时,成本模式显示 $0;Token 模式仍反映真实负载。
- 定期查看。 每周检查仪表板,以便及早发现异常峰值。
- 为任务选择合适的模型。 如果大部分用量来自用高成本模型处理简单任务,请考虑引导团队在这些场景中使用更轻量的模型。
- 使用按模型视图进行比较。 切换模型或添加新模型后,按模型细分可以显示该变更是否带来了预期影响。