跳到主要内容

成本跟踪

CubePlex 会跟踪整个组织的 LLM token 用量,帮助你监控负载与支出。用量仪表板位于 Admin > Insights/admin/insights/admin/cost 会重定向到此处)。

跟踪内容

通过 CubePlex 发起的每次 LLM 调用都会记录:

  • 输入 token——发送给模型的 token 数量(提示词、系统指令、工具结果等)。
  • 输出 token——模型在响应中生成的 token 数量。
  • 缓存读取 / 缓存写入 token——从提示词缓存中读取或写入提示词缓存的 token,按各自费率计费(通常远低于新的输入 token)。
  • 提供商和模型——处理该调用的提供商和模型。
  • 时间戳——调用的开始和结束时间。

每次调用还会记录每个模型的价格费率(输入、输出、缓存读取和缓存写入),并将其作为调用时的快照保存;因此,即使之后在模型管理中更改模型费率,历史成本仍保持准确。

成本跟踪还会记录沙箱计算事件,因此汇总数据不仅反映 LLM token 支出。

用量仪表板

仪表板默认以 token 为主要指标,这样在尚未配置模型价格时(否则成本会显示为 $0)仍然有用。使用顶栏的 Token | 成本 切换可在配置价格后查看美元成本。浏览器会记住你上次的选择。

主指标

模式KPI 与图表何时使用
Token(默认)总/输入/输出 token、平均 token/次、按 token 排序的堆叠序列始终有意义;无需定价
成本总成本、平均 $/次、按成本排序的序列已在模型管理中设置价格后

若切换到 成本 时总成本为 $0 但 token 非零,页面会显示简短提示并链到模型管理

随时间变化的用量 / 支出

可按每日每周粒度查看的时间序列图,并可按工作区模型用户拆分。Token 模式下纵轴为 token 总量;成本模式下为美元。用它发现趋势——例如新增成员后的用量增长、大批量任务峰值,或换模型带来的影响。

细分

除了全组织汇总外,仪表板还会按多种方式细分所选时段:

  • 按模型——哪些模型贡献了最多流量(或支出)。
  • 按工作区——哪些团队或项目最忙。
  • 按用户——每个人的用量。
  • 缓存效率——基于 token 字段的命中率(两种模式下均为 token 口径)。

每一行会显示输入/输出(及适用时的缓存)token、调用次数,以及当前主指标下的 token 合计或成本。

KPI 与筛选

汇总 KPI 使用所选日期范围内的全组织合计。工作区/模型筛选目前主要作用于时间序列图表。汇总侧筛选对齐是已知后续项。

导出

你可以将原始成本数据导出为 CSV——可导出整个组织,也可导出单个工作区——以便在电子表格中分析或导入自己的报表系统。

📸 截图占位符

截取内容: Admin > Insights 仪表板,含 Token | 成本切换、token(或成本)KPI、堆叠图与细分表。 资源: /img/admin/cost-dashboard.png

成本管理建议

  • 设置准确的成本费率。 确保模型管理中的输入和输出 token 费率反映实际的提供商定价。未配置费率时,成本模式显示 $0;Token 模式仍反映真实负载。
  • 定期查看。 每周检查仪表板,以便及早发现异常峰值。
  • 为任务选择合适的模型。 如果大部分用量来自用高成本模型处理简单任务,请考虑引导团队在这些场景中使用更轻量的模型。
  • 使用按模型视图进行比较。 切换模型或添加新模型后,按模型细分可以显示该变更是否带来了预期影响。