# 配额跟踪 & 使用监控 实时跟踪 token 消耗、监控配额上限、估算成本,并在配额用尽前获得提醒。绝不浪费订阅配额,也不超出预算上限。 --- ## 概览 9Router 为所有提供商提供完善的配额跟踪: - **实时 token 消耗** - 查看每次请求使用的 tokens - **配额上限与剩余** - 跟踪使用 vs 上限 - **重置倒计时** - 了解配额何时刷新 - **成本估算** - 计算付费层支出 - **月度报告** - 分析使用模式 - **告警与通知** - 接近上限时收到警告 --- ## 仪表盘总览 ### 配额摘要 ``` 仪表盘 → 主页 → 配额概览 ┌─────────────────────────────────────────────┐ │ Claude Code (cc/) │ │ ████████████░░░░░░░░ 2.5h / 5h (50%) │ │ 重置剩余: 2h 30m │ │ 成本: $0(订阅) │ └─────────────────────────────────────────────┘ ┌─────────────────────────────────────────────┐ │ Gemini CLI (gc/) │ │ ████████░░░░░░░░░░░░ 450 / 1000 (45%) │ │ 每日重置剩余: 18h 30m │ │ 本月: 45K / 180K (25%) │ │ 成本: $0(免费层) │ └─────────────────────────────────────────────┘ ┌─────────────────────────────────────────────┐ │ GLM-4.7 (glm/) │ │ ██████████████░░░░░░ 7M / 10M tokens (70%) │ │ 重置: 每日 10:00 AM(5h 35m 后) │ │ 今日成本: $4.20 │ └─────────────────────────────────────────────┘ ┌─────────────────────────────────────────────┐ │ MiniMax M2.1 (minimax/) │ │ ████████████████░░░░ 4M / 5M tokens (80%) │ │ 5h 滚动窗口 │ │ 成本(5h): $0.80 │ └─────────────────────────────────────────────┘ ┌─────────────────────────────────────────────┐ │ iFlow (if/) │ │ ████████████████████ 无限 │ │ 成本: $0(永久免费) │ └─────────────────────────────────────────────┘ ``` --- ## 实时 Token 消耗 ### 按请求跟踪 每次请求都会显示详细的 token 使用情况: ``` 仪表盘 → 活动 → 最近请求 请求 #1234 模型: cc/claude-opus-4-5-20251101 时间戳: 2026-02-04 04:15:32 Tokens: 输入: 1,250 tokens 输出: 850 tokens 合计: 2,100 tokens 成本: $0(订阅配额) 耗时: 3.2s 状态: ✅ 成功 ``` ### 实时使用监控 ``` 仪表盘 → 实时监控 当前请求: 模型: glm/glm-4.7 已流式输出 tokens: 450 / 预计 ~800 当前成本: $0.0009 耗时: 1.8s ``` ### 按模型分解 Token ``` 仪表盘 → 分析 → Token 使用 今日(2026-02-04): cc/claude-opus-4-5: 15M tokens($0,订阅) glm/glm-4.7: 8M tokens($4.80) if/kimi-k2-thinking: 3M tokens($0,免费) 合计: 26M tokens 成本: $4.80 ``` --- ## 配额上限与重置时间 ### 订阅型提供商 **Claude Code (Pro/Max)** ``` 配额类型: 基于时间(5 小时滚动) 上限: 5 小时使用时长 重置: 5 小时滚动窗口 + 每周刷新 跟踪: 每个模型的使用时间 仪表盘显示: Opus: 已用 2.5h / 5h Sonnet: 已用 1.2h / 5h Haiku: 已用 0.8h / 5h 每周重置: 每周一 00:00 UTC ``` **OpenAI Codex (Plus/Pro)** ``` 配额类型: 基于时间(5 小时滚动) 上限: 5 小时(Plus)/ 10 小时(Pro) 重置: 5 小时滚动窗口 + 每周刷新 仪表盘显示: GPT-5.2 Codex: 已用 3.5h / 5h 重置剩余: 1h 30m ``` **Gemini CLI(免费)** ``` 配额类型: 请求次数 + 月度 tokens 每日上限: 1,000 次请求 月度上限: 180,000 次补全 重置: 每日 00:00 UTC + 每月 1 日 仪表盘显示: 今日: 450 / 1,000 次请求 (45%) 本月: 45K / 180K 次补全 (25%) 每日重置剩余: 18h 30m 月度重置剩余: 26 天 ``` **GitHub Copilot** ``` 配额类型: 月度使用量 上限: 因套餐而异 重置: 每月 1 日 仪表盘显示: 使用: 月度配额 60% 重置: 2026 年 3 月 1 日(25 天后) ``` ### 低价提供商 **GLM-4.7** ``` 配额类型: 每日 token 上限 上限: 10M tokens/天(Coding Plan) 重置: 每日 10:00 AM 北京时间(UTC+8) 仪表盘显示: 已用: 7M / 10M tokens (70%) 剩余: 3M tokens 重置剩余: 5h 35m 今日成本: $4.20 ``` **MiniMax M2.1** ``` 配额类型: 5 小时滚动窗口 上限: 每 5 小时 5M tokens 重置: 连续滚动窗口 仪表盘显示: 已用(5h): 4M / 5M tokens (80%) 最早一次使用过期: 45m 成本(5h): $0.80 ``` **Kimi K2** ``` 配额类型: 月度订阅 上限: 10M tokens/月($9 固定) 重置: 订阅日每月一次 仪表盘显示: 已用: 6M / 10M tokens (60%) 重置: 2026 年 2 月 15 日(11 天后) 成本: $9/月(预付) ``` ### 免费提供商 **iFlow / Qwen / Kiro** ``` 配额类型: 无限(限速) 上限: 无硬上限 重置: 不适用 仪表盘显示: 今日已用: 5M tokens 成本: $0(永久免费) 状态: ✅ 可用 ``` --- ## 成本估算 ### 实时成本跟踪 ``` 仪表盘 → 成本 → 今日 订阅型提供商: $0 Claude Code: 15M tokens($0,包含) Gemini CLI: 3M tokens($0,免费层) 付费提供商: $4.80 GLM-4.7: 8M tokens($4.80) 输入: 6M × $0.60/1M = $3.60 输出: 2M × $2.20/1M = $4.40 合计: $4.80 免费提供商: $0 iFlow: 3M tokens($0) 今日合计: $4.80 ``` ### 月度支出报告 ``` 仪表盘 → 成本 → 本月(2026 年 2 月) 第 1 周(2 月 1-7 日): 订阅: $0(80M tokens) 付费: $15.20(25M tokens) 免费: $0(10M tokens) 合计: $15.20 第 2 周(2 月 8-14 日): 订阅: $0(75M tokens) 付费: $12.80(20M tokens) 免费: $0(8M tokens) 合计: $12.80 本月至今: $28.00 预计(30 天): ~$120 按提供商分解: GLM-4.7: $22.00 (78%) MiniMax M2.1: $6.00 (22%) 每 1M tokens 平均成本: $0.62 相比 ChatGPT API 节省: 97%($4,000 → $120) ``` ### 成本预测 ``` 仪表盘 → 成本 → 预测 基于近 7 天使用: 日均: 50M tokens 日成本: $4.50 月度预测: Tokens: 1,500M (1.5B) 成本: $135 分解: 订阅: 900M tokens($0) GLM-4.7: 450M tokens($90) MiniMax: 120M tokens($24) 免费: 30M tokens($0) 预算状态: 每日上限: $5 → 今日已用 90% 每月上限: $150 → 预计 90% ⚠️ 警告: 可能超出每月预算 ``` --- ## 使用仪表盘 ### 总览统计 ``` 仪表盘 → 分析 → 总览 今日(2026-02-04): 请求: 1,234 Tokens: 26M 成本: $4.80 平均响应时间: 2.1s 本周: 请求: 8,456 Tokens: 180M 成本: $28.00 成功率: 99.2% 本月: 请求: 15,234 Tokens: 320M 成本: $52.00 Top 模型: cc/claude-opus-4-5 (45%) ``` ### 按模型使用 ``` 仪表盘 → 分析 → 模型 Top 模型(本月): 1. cc/claude-opus-4-5: 145M tokens (45%) 2. glm/glm-4.7: 95M tokens (30%) 3. if/kimi-k2-thinking: 50M tokens (16%) 4. minimax/MiniMax-M2.1: 20M tokens (6%) 5. gc/gemini-3-flash: 10M tokens (3%) 成本分解: cc/claude-opus: $0(订阅) glm/glm-4.7: $45.00 if/kimi-k2-thinking: $0(免费) minimax/MiniMax-M2.1: $7.00 gc/gemini-3-flash: $0(免费) ``` ### 按时间使用 ``` 仪表盘 → 分析 → 时间线 按小时使用(今日): 00:00 - 01:00: 0.5M tokens 01:00 - 02:00: 0.2M tokens ... 08:00 - 09:00: 3.2M tokens(峰值) 09:00 - 10:00: 2.8M tokens ... 23:00 - 00:00: 0.8M tokens 峰值时段: 08:00 - 12:00(早上编码) 低谷时段: 00:00 - 06:00(夜间) ``` ### 按组合使用 ``` 仪表盘 → 分析 → 组合 premium-coding: 请求: 456 Tokens: 12M 成本: $2.40 分解: cc/claude-opus: 8M tokens (67%, $0) glm/glm-4.7: 3M tokens (25%, $1.80) minimax/MiniMax-M2.1: 1M tokens (8%, $0.20) budget-combo: 请求: 234 Tokens: 6M 成本: $1.20 分解: glm/glm-4.7: 4M tokens (67%, $2.40) if/kimi-k2-thinking: 2M tokens (33%, $0) ``` --- ## 告警与通知 ### 配额告警 ``` 仪表盘 → 设置 → 告警 配额预警: ✅ 配额使用 80% 时告警 ✅ 配额使用 90% 时告警 ✅ 配额耗尽时告警 ✅ 配额重置时通知 发送方式: ✅ 仪表盘通知 ✅ 邮件(可选) ✅ Webhook(可选) ``` **通知示例:** ``` ⚠️ Claude Code 配额已用 80% 剩余 2.5h(1h 30m 后重置) ⚠️ GLM-4.7 配额已用 90% 剩余 1M tokens(5h 后重置) ✅ Gemini CLI 配额已重置 1,000 次请求可用(每日上限) ``` ### 预算告警 ``` 仪表盘 → 设置 → 预算告警 每日预算: $5 ✅ 80%($4)告警 ✅ 100%($5)告警 ✅ 超额时自动切换到免费层 每月预算: $150 ✅ 50%($75)告警 ✅ 80%($120)告警 ✅ 100%($150)告警 ``` **通知示例:** ``` ⚠️ 每日预算已用 80% 今日花费 $4.00 / $5.00 ⚠️ 每月预算达到 50% 本月花费 $75 / $150 预计: $135(预算内) 🚨 每日预算超额 今日花费 $5.20 / $5.00 已自动切换到免费层 ``` ### 成本异常检测 ``` 仪表盘 → 设置 → 异常检测 ✅ 检测异常支出模式 ✅ 成本峰值告警(>2× 日均) ✅ 配额耗尽模式警告 告警示例: ⚠️ 检测到成本峰值 今日: $12.50(2.5× 日均) 原因: GLM-4.7 高用量(20M tokens) 建议: 检查主模型是否配额耗尽 ``` --- ## 最佳实践 ### 1. 每日监控配额 ``` 日常: 1. 查看仪表盘配额概览(30 秒) 2. 检查重置时间 3. 根据配额可用性规划使用 ``` **示例:** ``` 早晨检查: ✅ Claude Code: 5h 可用(刚重置) ✅ Gemini CLI: 1K 请求可用 ⚠️ GLM-4.7: 剩 2M tokens(10AM 重置) 行动: 早上工作用 Claude Code ``` ### 2. 设置预算上限 ``` 仪表盘 → 设置 → 预算: 每日: $5(防止超支) 每月: $150(与预算对齐) ``` **结果**:达到上限时自动切换到免费层。 ### 3. 优化组合使用 ``` 仪表盘 → 分析 → 组合: 查看哪些模型用得最多 调整组合顺序以最小化成本 ``` **示例:** ``` 当前: cc/claude-opus → glm/glm-4.7 80% 通过 Claude(好) 20% 通过 GLM($12/月) 优化后: gc/gemini-3-flash → cc/claude-opus → glm/glm-4.7 50% 通过 Gemini(免费) 40% 通过 Claude(订阅) 10% 通过 GLM($6/月) 节省: $6/月 ``` ### 4. 跟踪重置时间 ``` 仪表盘 → 配额 → 重置日程: Claude Code: 5h 滚动 + 每周一 Gemini CLI: 每日 00:00 UTC + 每月 1 日 GLM-4.7: 每日 10:00 AM 北京时间 MiniMax: 5h 滚动窗口 ``` **策略**:配额刚刷新时使用对应提供商。 ### 5. 查看月度报告 ``` 仪表盘 → 分析 → 月度报告: 总 tokens: 1.5B 总成本: $120 节省: 相比 ChatGPT API 节省 97% 洞察: - 60% 用量来自订阅($0) - 30% 通过 GLM($90) - 10% 通过免费层($0) 优化: - 增加 Gemini CLI 用量(免费) - 减少 GLM 用量(更贵) ``` --- ## API 访问 ### 获取配额状态 ```bash GET http://localhost:20128/api/quota Authorization: Bearer your-api-key Response: { "providers": [ { "id": "cc", "name": "Claude Code", "quota": { "used": 2.5, "limit": 5, "unit": "hours", "percentage": 50 }, "reset": { "type": "rolling", "window": "5h", "nextReset": "2026-02-04T06:45:00Z" }, "cost": { "today": 0, "month": 0, "currency": "USD" } }, { "id": "glm", "name": "GLM-4.7", "quota": { "used": 7000000, "limit": 10000000, "unit": "tokens", "percentage": 70 }, "reset": { "type": "daily", "time": "10:00 AM UTC+8", "nextReset": "2026-02-04T10:00:00+08:00" }, "cost": { "today": 4.20, "month": 52.00, "currency": "USD" } } ] } ``` ### 获取使用统计 ```bash GET http://localhost:20128/api/usage?period=today Authorization: Bearer your-api-key Response: { "period": "today", "date": "2026-02-04", "summary": { "requests": 1234, "tokens": 26000000, "cost": 4.80 }, "byModel": [ { "model": "cc/claude-opus-4-5", "requests": 456, "tokens": 15000000, "cost": 0 }, { "model": "glm/glm-4.7", "requests": 234, "tokens": 8000000, "cost": 4.80 } ] } ``` --- ## 故障排除 **问题:配额显示 0% 但请求失败** **方案:** 1. 检查提供商连接(仪表盘 → 提供商) 2. 确认 API keys 有效 3. 检查提供商是否宕机(状态页) 4. 尝试重新连接 OAuth 提供商 **问题:成本估算不正确** **方案:** 1. 仪表盘 → 设置 → 定价 2. 确认每个提供商的定价与当前一致 3. 若提供商调整费率,更新定价 4. 若差异持续,联系支持 **问题:重置时间没有更新** **方案:** 1. 刷新仪表盘(F5) 2. 检查系统时间是否正确 3. 确认时区设置 4. 若问题持续,重启 9Router **问题:未收到告警** **方案:** 1. 仪表盘 → 设置 → 告警 2. 确认邮箱地址正确 3. 检查垃圾邮件夹 4. 测试通知(Send Test 按钮) --- ## 相关 - [智能路由](./smart-routing.md) - 基于配额自动回退 - [组合](./combos.md) - 创建自定义回退链