mirror of
https://github.com/Nezumi-2711/9router.git
synced 2026-09-22 13:38:31 +00:00
14 KiB
14 KiB
配额跟踪 & 使用监控
实时跟踪 token 消耗、监控配额上限、估算成本,并在配额用尽前获得提醒。绝不浪费订阅配额,也不超出预算上限。
概览
9Router 为所有提供商提供完善的配额跟踪:
- 实时 token 消耗 - 查看每次请求使用的 tokens
- 配额上限与剩余 - 跟踪使用 vs 上限
- 重置倒计时 - 了解配额何时刷新
- 成本估算 - 计算付费层支出
- 月度报告 - 分析使用模式
- 告警与通知 - 接近上限时收到警告
仪表盘总览
配额摘要
仪表盘 → 主页 → 配额概览
┌─────────────────────────────────────────────┐
│ Claude Code (cc/) │
│ ████████████░░░░░░░░ 2.5h / 5h (50%) │
│ 重置剩余: 2h 30m │
│ 成本: $0(订阅) │
└─────────────────────────────────────────────┘
┌─────────────────────────────────────────────┐
│ Gemini CLI (gc/) │
│ ████████░░░░░░░░░░░░ 450 / 1000 (45%) │
│ 每日重置剩余: 18h 30m │
│ 本月: 45K / 180K (25%) │
│ 成本: $0(免费层) │
└─────────────────────────────────────────────┘
┌─────────────────────────────────────────────┐
│ GLM-4.7 (glm/) │
│ ██████████████░░░░░░ 7M / 10M tokens (70%) │
│ 重置: 每日 10:00 AM(5h 35m 后) │
│ 今日成本: $4.20 │
└─────────────────────────────────────────────┘
┌─────────────────────────────────────────────┐
│ MiniMax M2.1 (minimax/) │
│ ████████████████░░░░ 4M / 5M tokens (80%) │
│ 5h 滚动窗口 │
│ 成本(5h): $0.80 │
└─────────────────────────────────────────────┘
┌─────────────────────────────────────────────┐
│ iFlow (if/) │
│ ████████████████████ 无限 │
│ 成本: $0(永久免费) │
└─────────────────────────────────────────────┘
实时 Token 消耗
按请求跟踪
每次请求都会显示详细的 token 使用情况:
仪表盘 → 活动 → 最近请求
请求 #1234
模型: cc/claude-opus-4-5-20251101
时间戳: 2026-02-04 04:15:32
Tokens:
输入: 1,250 tokens
输出: 850 tokens
合计: 2,100 tokens
成本: $0(订阅配额)
耗时: 3.2s
状态: ✅ 成功
实时使用监控
仪表盘 → 实时监控
当前请求:
模型: glm/glm-4.7
已流式输出 tokens: 450 / 预计 ~800
当前成本: $0.0009
耗时: 1.8s
按模型分解 Token
仪表盘 → 分析 → Token 使用
今日(2026-02-04):
cc/claude-opus-4-5: 15M tokens($0,订阅)
glm/glm-4.7: 8M tokens($4.80)
if/kimi-k2-thinking: 3M tokens($0,免费)
合计: 26M tokens
成本: $4.80
配额上限与重置时间
订阅型提供商
Claude Code (Pro/Max)
配额类型: 基于时间(5 小时滚动)
上限: 5 小时使用时长
重置: 5 小时滚动窗口 + 每周刷新
跟踪: 每个模型的使用时间
仪表盘显示:
Opus: 已用 2.5h / 5h
Sonnet: 已用 1.2h / 5h
Haiku: 已用 0.8h / 5h
每周重置: 每周一 00:00 UTC
OpenAI Codex (Plus/Pro)
配额类型: 基于时间(5 小时滚动)
上限: 5 小时(Plus)/ 10 小时(Pro)
重置: 5 小时滚动窗口 + 每周刷新
仪表盘显示:
GPT-5.2 Codex: 已用 3.5h / 5h
重置剩余: 1h 30m
Gemini CLI(免费)
配额类型: 请求次数 + 月度 tokens
每日上限: 1,000 次请求
月度上限: 180,000 次补全
重置: 每日 00:00 UTC + 每月 1 日
仪表盘显示:
今日: 450 / 1,000 次请求 (45%)
本月: 45K / 180K 次补全 (25%)
每日重置剩余: 18h 30m
月度重置剩余: 26 天
GitHub Copilot
配额类型: 月度使用量
上限: 因套餐而异
重置: 每月 1 日
仪表盘显示:
使用: 月度配额 60%
重置: 2026 年 3 月 1 日(25 天后)
低价提供商
GLM-4.7
配额类型: 每日 token 上限
上限: 10M tokens/天(Coding Plan)
重置: 每日 10:00 AM 北京时间(UTC+8)
仪表盘显示:
已用: 7M / 10M tokens (70%)
剩余: 3M tokens
重置剩余: 5h 35m
今日成本: $4.20
MiniMax M2.1
配额类型: 5 小时滚动窗口
上限: 每 5 小时 5M tokens
重置: 连续滚动窗口
仪表盘显示:
已用(5h): 4M / 5M tokens (80%)
最早一次使用过期: 45m
成本(5h): $0.80
Kimi K2
配额类型: 月度订阅
上限: 10M tokens/月($9 固定)
重置: 订阅日每月一次
仪表盘显示:
已用: 6M / 10M tokens (60%)
重置: 2026 年 2 月 15 日(11 天后)
成本: $9/月(预付)
免费提供商
iFlow / Qwen / Kiro
配额类型: 无限(限速)
上限: 无硬上限
重置: 不适用
仪表盘显示:
今日已用: 5M tokens
成本: $0(永久免费)
状态: ✅ 可用
成本估算
实时成本跟踪
仪表盘 → 成本 → 今日
订阅型提供商: $0
Claude Code: 15M tokens($0,包含)
Gemini CLI: 3M tokens($0,免费层)
付费提供商: $4.80
GLM-4.7: 8M tokens($4.80)
输入: 6M × $0.60/1M = $3.60
输出: 2M × $2.20/1M = $4.40
合计: $4.80
免费提供商: $0
iFlow: 3M tokens($0)
今日合计: $4.80
月度支出报告
仪表盘 → 成本 → 本月(2026 年 2 月)
第 1 周(2 月 1-7 日):
订阅: $0(80M tokens)
付费: $15.20(25M tokens)
免费: $0(10M tokens)
合计: $15.20
第 2 周(2 月 8-14 日):
订阅: $0(75M tokens)
付费: $12.80(20M tokens)
免费: $0(8M tokens)
合计: $12.80
本月至今: $28.00
预计(30 天): ~$120
按提供商分解:
GLM-4.7: $22.00 (78%)
MiniMax M2.1: $6.00 (22%)
每 1M tokens 平均成本: $0.62
相比 ChatGPT API 节省: 97%($4,000 → $120)
成本预测
仪表盘 → 成本 → 预测
基于近 7 天使用:
日均: 50M tokens
日成本: $4.50
月度预测:
Tokens: 1,500M (1.5B)
成本: $135
分解:
订阅: 900M tokens($0)
GLM-4.7: 450M tokens($90)
MiniMax: 120M tokens($24)
免费: 30M tokens($0)
预算状态:
每日上限: $5 → 今日已用 90%
每月上限: $150 → 预计 90%
⚠️ 警告: 可能超出每月预算
使用仪表盘
总览统计
仪表盘 → 分析 → 总览
今日(2026-02-04):
请求: 1,234
Tokens: 26M
成本: $4.80
平均响应时间: 2.1s
本周:
请求: 8,456
Tokens: 180M
成本: $28.00
成功率: 99.2%
本月:
请求: 15,234
Tokens: 320M
成本: $52.00
Top 模型: cc/claude-opus-4-5 (45%)
按模型使用
仪表盘 → 分析 → 模型
Top 模型(本月):
1. cc/claude-opus-4-5: 145M tokens (45%)
2. glm/glm-4.7: 95M tokens (30%)
3. if/kimi-k2-thinking: 50M tokens (16%)
4. minimax/MiniMax-M2.1: 20M tokens (6%)
5. gc/gemini-3-flash: 10M tokens (3%)
成本分解:
cc/claude-opus: $0(订阅)
glm/glm-4.7: $45.00
if/kimi-k2-thinking: $0(免费)
minimax/MiniMax-M2.1: $7.00
gc/gemini-3-flash: $0(免费)
按时间使用
仪表盘 → 分析 → 时间线
按小时使用(今日):
00:00 - 01:00: 0.5M tokens
01:00 - 02:00: 0.2M tokens
...
08:00 - 09:00: 3.2M tokens(峰值)
09:00 - 10:00: 2.8M tokens
...
23:00 - 00:00: 0.8M tokens
峰值时段: 08:00 - 12:00(早上编码)
低谷时段: 00:00 - 06:00(夜间)
按组合使用
仪表盘 → 分析 → 组合
premium-coding:
请求: 456
Tokens: 12M
成本: $2.40
分解:
cc/claude-opus: 8M tokens (67%, $0)
glm/glm-4.7: 3M tokens (25%, $1.80)
minimax/MiniMax-M2.1: 1M tokens (8%, $0.20)
budget-combo:
请求: 234
Tokens: 6M
成本: $1.20
分解:
glm/glm-4.7: 4M tokens (67%, $2.40)
if/kimi-k2-thinking: 2M tokens (33%, $0)
告警与通知
配额告警
仪表盘 → 设置 → 告警
配额预警:
✅ 配额使用 80% 时告警
✅ 配额使用 90% 时告警
✅ 配额耗尽时告警
✅ 配额重置时通知
发送方式:
✅ 仪表盘通知
✅ 邮件(可选)
✅ Webhook(可选)
通知示例:
⚠️ Claude Code 配额已用 80%
剩余 2.5h(1h 30m 后重置)
⚠️ GLM-4.7 配额已用 90%
剩余 1M tokens(5h 后重置)
✅ Gemini CLI 配额已重置
1,000 次请求可用(每日上限)
预算告警
仪表盘 → 设置 → 预算告警
每日预算: $5
✅ 80%($4)告警
✅ 100%($5)告警
✅ 超额时自动切换到免费层
每月预算: $150
✅ 50%($75)告警
✅ 80%($120)告警
✅ 100%($150)告警
通知示例:
⚠️ 每日预算已用 80%
今日花费 $4.00 / $5.00
⚠️ 每月预算达到 50%
本月花费 $75 / $150
预计: $135(预算内)
🚨 每日预算超额
今日花费 $5.20 / $5.00
已自动切换到免费层
成本异常检测
仪表盘 → 设置 → 异常检测
✅ 检测异常支出模式
✅ 成本峰值告警(>2× 日均)
✅ 配额耗尽模式警告
告警示例:
⚠️ 检测到成本峰值
今日: $12.50(2.5× 日均)
原因: GLM-4.7 高用量(20M tokens)
建议: 检查主模型是否配额耗尽
最佳实践
1. 每日监控配额
日常:
1. 查看仪表盘配额概览(30 秒)
2. 检查重置时间
3. 根据配额可用性规划使用
示例:
早晨检查:
✅ Claude Code: 5h 可用(刚重置)
✅ Gemini CLI: 1K 请求可用
⚠️ GLM-4.7: 剩 2M tokens(10AM 重置)
行动: 早上工作用 Claude Code
2. 设置预算上限
仪表盘 → 设置 → 预算:
每日: $5(防止超支)
每月: $150(与预算对齐)
结果:达到上限时自动切换到免费层。
3. 优化组合使用
仪表盘 → 分析 → 组合:
查看哪些模型用得最多
调整组合顺序以最小化成本
示例:
当前: cc/claude-opus → glm/glm-4.7
80% 通过 Claude(好)
20% 通过 GLM($12/月)
优化后: gc/gemini-3-flash → cc/claude-opus → glm/glm-4.7
50% 通过 Gemini(免费)
40% 通过 Claude(订阅)
10% 通过 GLM($6/月)
节省: $6/月
4. 跟踪重置时间
仪表盘 → 配额 → 重置日程:
Claude Code: 5h 滚动 + 每周一
Gemini CLI: 每日 00:00 UTC + 每月 1 日
GLM-4.7: 每日 10:00 AM 北京时间
MiniMax: 5h 滚动窗口
策略:配额刚刷新时使用对应提供商。
5. 查看月度报告
仪表盘 → 分析 → 月度报告:
总 tokens: 1.5B
总成本: $120
节省: 相比 ChatGPT API 节省 97%
洞察:
- 60% 用量来自订阅($0)
- 30% 通过 GLM($90)
- 10% 通过免费层($0)
优化:
- 增加 Gemini CLI 用量(免费)
- 减少 GLM 用量(更贵)
API 访问
获取配额状态
GET http://localhost:20128/api/quota
Authorization: Bearer your-api-key
Response:
{
"providers": [
{
"id": "cc",
"name": "Claude Code",
"quota": {
"used": 2.5,
"limit": 5,
"unit": "hours",
"percentage": 50
},
"reset": {
"type": "rolling",
"window": "5h",
"nextReset": "2026-02-04T06:45:00Z"
},
"cost": {
"today": 0,
"month": 0,
"currency": "USD"
}
},
{
"id": "glm",
"name": "GLM-4.7",
"quota": {
"used": 7000000,
"limit": 10000000,
"unit": "tokens",
"percentage": 70
},
"reset": {
"type": "daily",
"time": "10:00 AM UTC+8",
"nextReset": "2026-02-04T10:00:00+08:00"
},
"cost": {
"today": 4.20,
"month": 52.00,
"currency": "USD"
}
}
]
}
获取使用统计
GET http://localhost:20128/api/usage?period=today
Authorization: Bearer your-api-key
Response:
{
"period": "today",
"date": "2026-02-04",
"summary": {
"requests": 1234,
"tokens": 26000000,
"cost": 4.80
},
"byModel": [
{
"model": "cc/claude-opus-4-5",
"requests": 456,
"tokens": 15000000,
"cost": 0
},
{
"model": "glm/glm-4.7",
"requests": 234,
"tokens": 8000000,
"cost": 4.80
}
]
}
故障排除
问题:配额显示 0% 但请求失败
方案:
- 检查提供商连接(仪表盘 → 提供商)
- 确认 API keys 有效
- 检查提供商是否宕机(状态页)
- 尝试重新连接 OAuth 提供商
问题:成本估算不正确
方案:
- 仪表盘 → 设置 → 定价
- 确认每个提供商的定价与当前一致
- 若提供商调整费率,更新定价
- 若差异持续,联系支持
问题:重置时间没有更新
方案:
- 刷新仪表盘(F5)
- 检查系统时间是否正确
- 确认时区设置
- 若问题持续,重启 9Router
问题:未收到告警
方案:
- 仪表盘 → 设置 → 告警
- 确认邮箱地址正确
- 检查垃圾邮件夹
- 测试通知(Send Test 按钮)