
Gemini CLI 没怎么用却触顶?Code Assist 共享配额排查指南
Gemini CLI 配额早早见底,原因通常不在账号,而在你挂在哪块计量表上。如何分清免费消费者套餐、CLI Google 登录与 API key 三条路径,理解共享配额结构,并在不换号的前提下恢复。
你只输入了几条 prompt,Gemini CLI 就提示用量已达上限。第一反应往往是怀疑账号出了问题。多数时候,真正的原因是误解了自己挂在哪块计量表上——Gemini 的限额取决于登录方式与请求经过的产品线。先诊断,再解决。
第零步:先确认你在哪块计量表上
长得一模一样的"已达上限"提示,背后可能是完全不同的配额池。Google 官方 CLI 文档给出了完整结构(Gemini CLI 文档,"Quota and pricing",2026-09-17 查证):
| 认证路径 | 档位 | 每用户每日最大模型请求数 |
|---|---|---|
| Google 账号登录(Code Assist 个人版) | 免费 | 1,000 |
| Google AI Pro 订阅 | 付费 | 1,500 |
| Google AI Ultra 订阅 | 付费 | 2,000 |
| Gemini API key | 免费档 | 250——仅限 Flash 模型 |
| Gemini API key | 按量付费 | 因档位而异 |
| Vertex AI | Express 模式 | 因账号而异 |
| Google Workspace + Code Assist 许可 | Standard / Enterprise | 1,500 / 2,000 |
这里有个典型的混淆陷阱:消费者版 Gemini 订阅(网页/应用的 "Gemini for Workspace" 套餐)不适用于驱动 CLI 的 API 用量——Google 文档明确做了切割。所以"我有付费 Gemini 套餐,为什么 CLI 还把我掐了"会发生:网页订阅与 CLI/API 路径挂在不同计量表上。真正提升 CLI 上限的,是通过 CLI 内 Google 账号登录使用的 Google AI Pro/Ultra(Workspace 账号则是 Code Assist 许可)。
接入你已经付费的 Claude 或 Codex,其余交给成本只有零头的工作模型。
下载 meshcode →为什么"没怎么用"也会耗尽——共享的三个维度
维度一:CLI 与 Code Assist agent 模式合并计量。 Google 配额文档原话:"Gemini Code Assist agent 模式与 Gemini CLI 的请求配额是合并的",且每日上限"跨两种入口使用的所有模型版本或家族聚合计算"(Google Cloud,"Quotas and limits",2026-09-17 查证)。同一个 Google 账号如果还登录着 IDE 插件、另一台机器的 CLI,或某个定时脚本,它们都在喝同一个每日池。你的终端只显示三条 prompt;计量表看到的是整个编队。
2. 一条 prompt 可能折算成多次模型请求。 同一文档写明:agent 模式或 CLI 中"一条 prompt 可能产生多次模型请求"。读文件、改代码、跑验证的 Agent 循环,会把看得见的几条 prompt 放大成多次计量请求——机制拆解见一条 prompt 为什么消耗多次请求。所以"我只发了 3 条 prompt,为什么少了 40 个请求"是正常行为,不是被偷。
3. 每分钟请求数是另一道更小的闸门。 文档补充说明,请求"按用户按分钟限制,且在高负载时段受服务可用性影响"。这道闸门的限流几分钟内解除;每日池耗尽则不会。区分这两者,就是排查的大半内容。
排查清单(按顺序执行)
- 原样记录报错——完整消息、时间戳、当时在做什么。如果你在用 API key,保存前先遮住密钥/项目 ID 等凭证。这是唯一能留存到提工单或论坛发帖时的证据。
- 确认认证路径。 在 CLI 里运行
/about查看当前登录的账号与认证方式,对照上表找到自己那一行。后续一切判断都取决于这一步。 - 查看会话用量:
/stats model。 按 CLI 文档说明,该命令显示当前会话的 token 用量以及与你当前配额相关的限制(2026-09-17 查证)。 - 记下时间,稍等后短暂重试。 几分钟内恢复,多半是每分钟闸门(每分钟限制每分钟重置);持续数小时则嫌疑落在每日池——每日限额按 Google 的时刻表重置,文档不保证确切时点,你自己记录的时间就是唯一依据。
- 审计同一身份的其他入口。 同一 Google 账号在别处登录——另一台机器、CI、某个脚本——都算进同一个每日池。下结论"配额不对"之前,先把它们加总。
- 数字仍然对不上,先本地复核,再考虑换任何东西。 同一账号重新认证、重读
/stats是安全的。轮换账号或尝试绕过配额属于违反服务条款,本指南不提供此类帮助。
常见误读
- 以为消费者订阅等于 API 额度。 网页订阅与 CLI/API 计量在设计上就是分开的。升级 AI Pro 提高的是 CLI Google 登录路径的上限,不会给 API key 充值。
- 把每个 429 都读成"今天完了"。 在 API key 路径上,429 可能来自每分钟请求数、每分钟 token 数、每日请求数,或滚动窗口上的支出限制。Google API 文档把 RPM/TPM/RPD 列为三个常设维度,并注明每日配额在太平洋时间午夜重置(Google AI,"Rate limits",2026-09-17 查证)。
- 轻信陌生人的数字。 这个类目的配额经常变动。六个月前的论坛帖子,永远输给今天
/stats的输出。
恢复干活
搞清撞上的是哪道闸门后,选项其实很短:每分钟限流就退避重试;每日池问题就调整任务时段或改道;最有用的,是给任务准备第二条不中断的路——这正是"干净交接给另一个 Agent"的价值:如何不丢工作地交接。
meshcode 让每个 Agent 在自己的窗格中、用自己的认证与限额接入——一个窗格耗尽当日配额时,你带着同一份笔记在下一个窗格继续。
相关阅读:为什么 Gemini 的上限不是一个数字 · 一条 prompt 为什么消耗多次请求 · Claude Code 上限后的交接。
更多博客文章
一条 Prompt 为什么消耗多次请求?AI 编程 Agent 的计费结构
一条 prompt 并不等于一次模型调用。Agent 会反复发送上下文、调用工具、重试——一天额度就这样被分批吃掉。这里讲清计量发生在哪里、为什么小任务也会烧光请求配额,以及如何测量你自己的会话。
GPT-6 Astra 用量上限详解:Chat 上限、Codex 配额与 API 429
GPT-6 Astra 的上限出现在三套不同的系统里——ChatGPT 套餐上限、Codex 配额和 API 速率限制——而每一种的失败方式都不一样。这里讲这些提示实际意味着什么,以及分别该怎么应对。
Gemini 使用量上限详解:免费档、AI Pro,以及为什么上限不是一个数字
Gemini 的用量上限在 CLI、API 和 Google AI 订阅里的运作方式各不相同——是请求次数,不是 token 预算。这里讲这些上限实际意味着什么,以及撞上时该怎么办。