Endless Migration · 数据截至 2026-09-26(北京时间日)
口径:ods.daily_cost_detail,只看生产环境 env=prod(测试环境已全量走 endless,不计入);apiType='endless' 记为已走 endless,带 _endless 后缀的 promptCode 并回原 code。状态按 09-26 当日 endless 占比判定:≥95% 已切换,5–95% 部分走 endless,其余未切换。code 总数按近 7 天有流量的 130 个计。今日数据取自 server_event_log 北京时间 0–14 时。
时间口径:数据记录的是北京时间(UTC+8),报表按北京时间日统计:每天从北京时间 00:00 到 24:00,对应 UTC 前一日 16:00 到当日 16:00。
solving_module_humc_single 已切,solving_module_common_transform 系列还在直连。module_part_final_answer(+5.6pp)和 solving_module_common_transform(+4.2pp)。逐日明细、里程碑时间轴和按业务阶段的切换进度见 PromptCode 请求半月报 →「Endless 切换进度」。
01 · Progress
gemini 经 endless 在 09-16 小量试切,09-17 起分批放量:09-17 solving_module_humc_single,09-18 generate_recap_text,09-19 question_type_module_v2_simulator,09-22 切完 question_type_module_solver_mode_v1 与 generate_flashcard_text 后到 51.3–52.1%。09-23 起只切了 5 个小 code(合计日请求约 3,200),今日至今 51.6%。
09-12~15 的高点不是网关切换:那几天多个 code 改用 gpt-5.6-luna(gpt 系列本来就经 endless 调用),09-16 换回 gemini 直连。
| 日期 | 总请求 | endless | 占比 | genai | qwen | 其他 |
|---|---|---|---|---|---|---|
| 2026-09-01 | 1,405,842 | 62,053 | 4.4% | 1,219,037 | 113,192 | 11,560 |
| 2026-09-02 | 1,334,635 | 59,571 | 4.5% | 1,154,138 | 109,684 | 11,242 |
| 2026-09-03 | 1,269,712 | 57,267 | 4.5% | 1,094,803 | 105,953 | 11,689 |
| 2026-09-04 | 1,236,771 | 56,285 | 4.6% | 1,065,684 | 103,461 | 11,341 |
| 2026-09-05 | 1,039,987 | 48,104 | 4.6% | 895,898 | 87,425 | 8,560 |
| 2026-09-06 | 914,482 | 40,942 | 4.5% | 788,968 | 76,907 | 7,665 |
| 2026-09-07 | 1,577,428 | 69,313 | 4.4% | 1,362,996 | 133,784 | 11,335 |
| 2026-09-08 | 1,411,485 | 63,207 | 4.5% | 1,225,836 | 111,072 | 11,370 |
| 2026-09-09 | 1,727,320 | 79,059 | 4.6% | 1,490,626 | 136,916 | 20,719 |
| 2026-09-10 | 1,600,509 | 72,897 | 4.6% | 1,387,157 | 126,240 | 14,215 |
| 2026-09-11 | 1,489,310 | 71,292 | 4.8% | 1,284,311 | 122,341 | 11,366 |
| 2026-09-12 | 882,151 | 571,059 | 64.7% | 219,257 | 83,864 | 7,971 |
| 2026-09-13 | 846,943 | 567,243 | 67.0% | 192,306 | 78,128 | 9,266 |
| 2026-09-14 | 1,851,026 | 857,172 | 46.3% | 815,278 | 164,649 | 13,927 |
| 2026-09-15 | 1,754,174 | 288,090 | 16.4% | 1,319,085 | 141,092 | 5,907 |
| 2026-09-16 | 1,672,822 | 97,089 | 5.8% | 1,437,495 | 129,618 | 8,620 |
| 2026-09-17 | 1,706,089 | 233,292 | 13.7% | 1,337,375 | 128,727 | 6,695 |
| 2026-09-18 | 1,572,340 | 329,136 | 20.9% | 1,110,159 | 126,933 | 6,112 |
| 2026-09-19 | 1,139,173 | 357,511 | 31.4% | 682,888 | 95,410 | 3,364 |
| 2026-09-20 | 1,041,446 | 325,674 | 31.3% | 623,488 | 88,479 | 3,805 |
| 2026-09-21 | 2,166,323 | 710,893 | 32.8% | 1,269,785 | 178,547 | 7,098 |
| 2026-09-22 | 1,899,729 | 980,120 | 51.6% | 768,674 | 144,406 | 6,529 |
| 2026-09-23 | 1,775,579 | 910,017 | 51.3% | 730,660 | 128,878 | 6,024 |
| 2026-09-24 | 1,773,410 | 910,096 | 51.3% | 724,344 | 132,280 | 6,690 |
| 2026-09-25 | 1,639,696 | 840,439 | 51.3% | 670,826 | 122,970 | 5,461 |
| 2026-09-26 | 1,186,427 | 618,333 | 52.1% | 470,744 | 94,456 | 2,894 |
02 · Remaining
同模型可直接切 21.3pp:16 个 code 当前用的模型已经在 endless 上跑,只需换通道。需先开通模型 14.7pp:主要是 gemini-3-flash 和 3.1-flash-lite。自建 qwen 8.0pp,是否纳入迁移待定。其余 3.9pp 是部分走 endless、长输出和长尾。
每日走 endless 的 Top 20 和 98 个待切换 code 的完整列表见 PromptCode 请求半月报 →「Endless 切换进度」tab。
03 · Today
按 09-26 请求量排序。「切到此行后」表示从第 1 行切到这一行时的整体 endless 占比,今天切到哪一行由你们定;in / out 为近 7 天平均 token(含 endless 流量)。generate_flashcard_image / generate_recap_image 的 text 版本已分别在 09-22 / 09-18 起用同一模型 gemini-3.8-flash 跑在 endless 上。
| promptCode | 当前通道 · 模型 | 09-26 请求 | 占比 pp | 切到此行后 | 近 7 天 in / out |
|---|---|---|---|---|---|
| module_part_final_answer | genai · gemini-3.5-flash-lite | 66,849 | +5.63 | 57.8% | 4,081 / 88 |
| solving_module_common_transform | genai · gemini-3.5-flash-lite | 49,575 | +4.18 | 61.9% | 4,392 / 427 |
| solving_module_common_transform_k12 | genai · gemini-3.5-flash-lite | 26,197 | +2.21 | 64.1% | 5,124 / 562 |
| thinking_module_common_k12 | genai · gemini-3.8-flash | 22,662 | +1.91 | 66.0% | 5,243 / 811 |
| generate_flashcard_image | genai · gemini-3.8-flash | 21,582 | +1.82 | 67.9% | 5,158 / 217 |
| generate_recap_image | genai · gemini-3.8-flash | 21,581 | +1.82 | 69.7% | 5,234 / 190 |
| question_ask_more_full_multi_context_check | genai · gemini-3.7-flash | 10,480 | +0.88 | 70.6% | 15,649 / 494 |
| thinking_module_common_execute_code_v2 | genai · gemini-3.7-flash | 7,678 | +0.65 | 71.2% | 1,766 / 1,676 |
| solving_module_chat_graph_business | genai · gemini-3.7-flash | 7,114 | +0.60 | 71.8% | 3,785 / 839 |
| question_ask_more_full_context_check | genai · gemini-3.7-flash | 5,460 | +0.46 | 72.3% | 10,901 / 549 |
| question_solving_android_humanities_single | genai · gemini-3.5-flash-lite | 4,470 | +0.38 | 72.7% | 1,089 / 393 |
| document_classification_prompt | genai · gemini-3.8-flash | 2,510 | +0.21 | 72.9% | 4,923 / 93 |
| question_ask_more_full_multi_context | genai · gemini-3.8-flash | 1,910 | +0.16 | 73.0% | 8,392 / 578 |
| plugin-oneclick-solve | genai · gemini-3.8-flash | 1,714 | +0.14 | 73.2% | 6,472 / 1,007 |
| question-types-all-in-one-v4 | genai · gemini-3.8-flash | 1,379 | +0.12 | 73.3% | 2,189 / 78 |
| question_boundary_detection_v1 | genai · gemini-3.8-flash | 1,167 | +0.10 | 73.4% | 3,772 / 139 |
04 · New models
| 当前模型 | code 数 | 09-26 请求 | 占比 pp | 主要 promptCode(按量) |
|---|---|---|---|---|
| gemini-3-flash | 7 | 79,509 | +6.7 | thinking_module_common_v2, solving_module_chat_graph, solving_module_chat_graph_statistics, thinking_module_common_execute_code_k12 等 |
| gemini-3.1-flash-lite | 6 | 69,567 | +5.9 | module_part_final_answer_graph_plotly, memory_extract_v1, webQuestionMoreStream, module_part_final_answer_chemistry 等 |
| gemini-2.5-flash | 3 | 20,478 | +1.7 | plugin_course_history_title_summary, Android_AI_Sync_tutor, thinking_arena_module_common |
| gemini-2.5-flash-tts | 1 | 3,417 | +0.3 | htmlStepTts |
| gemini-2.5-flash-lite | 1 | 1,996 | +0.2 | recommendAskMoreQuestion_A_noImg |
05 · Others
answer_reference_highlight 与 _image 版本约 9% 走 endless。endless 侧是 gpt-5.5,直连侧是 gemini-3-flash,这是按模型分流,不是网关灰度。question_type_combined 一个 code(Qwen3.6-35B),它走不走 endless 决定"100%"的分母。solving_generate_simulator 平均输出 3,828 token,模型已在 endless 上,切之前先确认 endless 的流式超时设置。| 模型 | 请求 |
|---|---|
| gemini-3.7-flash | 1,845,544 |
| gemini-3.8-flash | 1,656,388 |
| gemini-3.5-flash-lite | 876,946 |
| gpt-5.5 | 385,313 |
| gemini-embedding | 384,977 |
| gpt-5.6-luna | 130,172 |
| gemini-3.5-flash | 13,006 |
| gpt-image-2.5-flare | 3,226 |
| promptCode | endless 侧模型 | 稳定起始 | 09-26 请求 |
|---|---|---|---|
| question_type_module_v2_simulator | gemini-3.7-flash | 09-19 | 120,620 |
| question_type_module_solver_mode_v1 | gemini-3.5-flash-lite | 09-22 | 116,447 |
| generate_recap_text | gemini-3.8-flash | 09-18 | 103,181 |
| generate_flashcard_text | gemini-3.8-flash | 09-22 | 103,181 |
| solving_module_humc_single | gemini-3.7-flash | 09-17 | 74,324 |
| embeddingQuestion | gemini-embedding | 09-21 | 48,243 |
| question-visuals-generator-default | gpt-5.5 | 09-01 | 20,795 |
| question-visuals-generator-chemistry | gpt-5.5 | 09-01 | 8,343 |
| question_type_judgment_suitable_manim | gpt-5.5 | 09-01 | 6,751 |
| gpt41MiniOCR | gpt-5.6-luna | 09-15 | 3,687 |
| generate_physics_manim | gpt-5.5 | 09-01 | 2,746 |
| solving_module_humc_plural | gemini-3.7-flash | 09-17 | 2,270 |
Solvely · LLM Gateway Migration Brief
口径:ods.daily_cost_detail(日聚合)+ ods.server_event_log(原始请求日志),仅 env=prod、source LIKE 'provider%'、promptToken>0 的真实模型调用。统计窗口 2026-01-01 ~ 2026-09-13(表内最早数据即 2026-01-01,不足完整一年),分位数与时延取近 7–14 天;Gemini 容量申请对账一节按近 180 天、仅 Gemini 模型的口径单独重算。日期与时段口径见下方说明。
时间口径:数据记录的是北京时间(UTC+8),按日数据用北京时间日统计(每天 = UTC 前一日 16:00 至当日 16:00);日内曲线横轴用 UTC,括号内是北京时间。
01 · Volume
4 月见顶(日均 304 万),5 月起随业务与模型切换回落,8 月触底后 9 月回升约 34%。给网关做容量规划时用 近 30 天日均 110 万 + 历史峰值 431 万 两个数,不要只用当前值——去年同期到峰值的爬坡只用了 3 个月。

| 月份 | 请求数 | 日均 | 单日峰值 | token (in+out) | 成本 USD |
|---|---|---|---|---|---|
| 2026-01 | 48,902,110 | 1,577,487 | 3,431,556 | 126 B | 87,049 |
| 2026-02 | 74,893,227 | 2,674,758 | 3,803,120 | 189 B | 144,267 |
| 2026-03 | 83,177,021 | 2,683,130 | 3,891,782 | 216 B | 157,173 |
| 2026-04 | 91,331,242 | 3,044,375 | 4,309,589 | 252 B | 170,567 |
| 2026-05 | 65,107,113 | 2,100,229 | 3,631,809 | 188 B | 98,645 |
| 2026-06 | 46,969,968 | 1,565,666 | 1,997,231 | 161 B | 77,082 |
| 2026-07 | 45,221,175 | 1,458,748 | 2,068,404 | 155 B | 81,382 |
| 2026-08 | 29,701,295 | 958,106 | 1,579,449 | 100 B | 58,449 |
| 2026-09 (13 天) | 16,736,575 | 1,287,429 | 1,727,320 | 59 B | 39,415 |
| 合计 | 502,039,726 | 1,961,093 | 4,309,589 | 1,446 B | 914,030 |
02 · Rate & Concurrency
日内峰谷比 6.4 倍(Gemini,180 天):最忙的是 UTC 01–02 时(北京 09–10 时)约 30 QPS,最闲的是 UTC 09–10 时(北京 17–18 时)不到 5 QPS。网关限流阈值必须按峰值秒级设定,按日均设会在每天高峰被打穿。历史秒级峰值 211 QPS,出现在 4 月业务高点,是当前常态的 14 倍。

| 速率口径(近 14 天) | 均值 | P50 | P95 | P99 | 最大 |
|---|---|---|---|---|---|
| QPS(每秒请求) | 15.4 | 14 | 35 | 48 | 115 |
| QPM(每分钟请求) | 909 | 872 | 1,900 | 2,631 | 3,754 |
| 峰值小时请求数 | 102,669 | — | — | — | 196,220 |
| QPS(近 180 天 · 仅 Gemini) | 17.9 | — | — | 61 | 211 |
| QPM(近 180 天 · 仅 Gemini) | 1,072 | — | — | 3,425 | 5,649 |
| TPM(近 180 天 · 仅 Gemini) | 3.93 M | — | — | 12.50 M | 19.64 M |
| 并发估算 QPS × 平均时长 | 估算在途请求 |
|---|---|
| 平均态(15.4 QPS × 4.24 s) | ≈ 65 |
| P99 态(48 QPS × 4.24 s) | ≈ 204 |
| 瞬时峰值(115 QPS × 4.24 s) | ≈ 488 |
| 建议网关连接池下限 | 800(1.6× 峰值) |
99.2% 的请求是 流式(SSE),平均持续 4.24 秒、P99 接近 30 秒。网关必须按长连接容量而非 QPS 容量做规划,且空闲超时不能低于 60 秒。
03 · Payload
典型请求是 大输入、小输出:输入约 3,200 token、输出约 270 token,比例接近 12:1。对网关意味着上行带宽和请求体解析是瓶颈,不是下行。
| 单请求 token(近 7 天) | 均值 | P50 | P90 | P99 | 最大 |
|---|---|---|---|---|---|
| prompt(输入,含 cached) | 3,169 | 2,979 | 5,066 | 10,052 | 316,448 |
| completion(输出) | 267 | 165 | 569 | 2,068 | 74,850 |
| cached(命中缓存部分) | 408 | 0 | 1,792 | 5,567 | 156,743 |
| thinking(推理) | 21 | 0 | 41 | 341 | 121,304 |
| 换算成字节(按 4 B/token) | 值 |
|---|---|
| 平均请求体 | ≈ 12.4 KB |
| P99 请求体 | ≈ 39 KB |
| 最大请求体 | ≈ 1.2 MB |
| 平均上行带宽 | ≈ 190 KB/s |
| 峰值上行带宽 | ≈ 1.4 MB/s |
| 请求形态占比(近 7 天) | 占比 |
|---|---|
| 流式响应(SSE) | 99.2% |
| 命中 prompt cache | 11.6% |
| 带 tool / function call | 1.5% |
| 带图片(多模态) | 0.4% |
网关必须原样透传 prompt caching 语义(cache_control / implicit cache)。缓存命中的月份(4–6 月)cached token 占输入的 30–36%,最近仍有 11%;一旦网关重写或重排 prompt 导致缓存失效,输入侧计费会按未缓存价重算——按 4 月口径相当于凭空多付三成输入成本。
04 · Model Mix
模型迭代非常快:9 个月里主力模型换了 4 代,2026-09 当月新上线的 gemini-3.8-flash、gpt-5.6-luna、gemini-3.5-flash-lite 合计已占 20%。接新模型的速度是选型的硬指标,比当前支持的模型清单更重要。

| 模型(近 7 天) | 请求 | 占比 | 平均耗时 | P95 耗时 |
|---|---|---|---|---|
| gemini-3-flash-preview | 2,665,049 | 27.0% | 4.77 s | 12.93 s |
| gpt-5.6-luna | 1,902,819 | 19.3% | 5.32 s | 11.12 s |
| gemini-3.1-flash-lite | 1,344,329 | 13.6% | 3.39 s | 4.89 s |
| gemini-3.8-flash | 1,213,456 | 12.3% | 4.02 s | 7.83 s |
| gemini-3.5-flash-lite | 1,037,448 | 10.5% | 4.04 s | 5.95 s |
| Qwen3.6-35B(自建) | 832,864 | 8.4% | 0.94 s | 1.28 s |
| gpt-5.5 | 346,632 | 3.5% | 4.77 s | 16.50 s |
| gemini-3.7-flash | 263,743 | 2.7% | 7.44 s | 21.83 s |
| 其他 9 个模型 | 274,315 | 2.7% | — | — |
| 供应商通道(近 90 天) | 请求占比 | 成本占比 |
|---|---|---|
| genai(Google Gemini API) | 91.3% | 91.0% |
| qwen(自建推理) | 5.7% | — |
| endless(新网关) | 2.1% | 7.4% |
| azure(Azure OpenAI) | 0.6% | 1.2% |
| vertex(Google Vertex AI) | 0.3% | 0.4% |
| deepseek / elevenlabs | <0.1% | <0.1% |
91% 流量压在 Google GenAI 单一通道上。网关方案要能同时代理 Gemini 原生 API、Azure OpenAI、OpenAI 兼容端点、自建 vLLM/Qwen 端点 四类协议;只做 OpenAI-compatible 转换会丢掉 Gemini 的 thinking / implicit cache / 多模态字段。
05 · Latency Baseline
现状是直连供应商的时延,网关引入的额外跳数必须控制在可接受范围内。建议把下表写进 SLA,按 网关自身开销 P99 < 50 ms 验收。
| 指标(近 7 天,全量模型) | 均值 | P50 | P90 | P95 | P99 |
|---|---|---|---|---|---|
| TTFT 首 token 时延 | 3.15 s | 1.97 s | 5.64 s | 8.07 s | 24.49 s |
| 整请求耗时 | 4.24 s | 2.52 s | 7.39 s | 10.39 s | 29.74 s |
06 · Traffic Shape
| 客户端 | 占比 |
|---|---|
| iOS | 63.2% |
| 浏览器插件 | 19.6% |
| Android | 12.5% |
| Web | 4.7% |
| 项目 | 占比 |
|---|---|
| wordle-third | 27.6% |
| word-brick | 27.6% |
| garden-word-search | 18.7% |
| chess-kingdom / chess-eff81 | 12.3% |
| solvely-lite | 4.6% |
| 其他 15+ 个 key | 9.2% |
共 20+ 个独立 API key / 业务线共用同一批模型配额,网关必须支持 按 key 的独立限流、配额与成本归集。当前 Top 25 业务场景(promptCode)覆盖 ~85% 流量,单场景输入规模从 1.3K 到 16K token 不等,说明限流不能只按请求数、还要按 token 速率(TPM)。
| Top 业务场景 | 请求占比 | 平均输入 token | 平均输出 token |
|---|---|---|---|
| question_type_module_solver_mode_v1 | 12.7% | 3,432 | 23 |
| generate_recap_text | 10.0% | 1,982 | 189 |
| generate_flashcard_text | 9.9% | 1,834 | 179 |
| question_type_module_v2 | 7.1% | 3,337 | 61 |
| question_type_combined | 5.7% | 3,013 | 82 |
| solving_module_common_transform | 5.6% | 4,428 | 409 |
| question_ask_more_full_multi_context_check | 0.8% | 16,045 | 438 |
07 · Reconciliation
按申请书自述口径独立复算:server_event_log、近 180 天、modelName LIKE '%gemini%' 且排除 embedding、token 计 input+output+thinking+tool、取历史最大值。九项数字全部能用申请书自述的方法复现。「申请值相对实测」为正,是申请书「向上取整」留的余量(例如日请求 3,458,928 取整成 4,000,000,多 15.6%),不是算错;为负的三项(−0.4%~−1.0%)是统计窗口差一两天的正常漂移。「可复现」只说明算法对得上,不代表该用这个数——第 9 项就是例子。
| 申请书数值 | 实测(180 天 · Gemini) | 申请值相对实测 | 判定 |
|---|---|---|---|
| 峰值 QPS 250 | 211 | +18.5% | 可复现 |
| 峰值 RPM 6,000 | 5,649 | +6.2% | 可复现 |
| 峰值 TPM 20,000,000 | 19,640,798 | +1.8% | 可复现 |
| 日请求量 4,000,000 | 3,458,928 | +15.6% | 可复现 |
| 日 Token 量 13,000,000,000 | 12,180,914,784 | +6.7% | 可复现 |
| 平均输入 3,178 tokens | 3,204 | −0.8% | 可复现 |
| 平均输出 224 tokens | 225 | −0.4% | 可复现 |
| P99 单请求 15,992 tokens | 16,147 | −1.0% | 可复现 |
| 单请求最大 2,040,160 tokens | 2,040,160 | 0 | 可复现,但该记录是脏数据 |
一 · 「单次请求最大 2,040,160 tokens」要换成干净口径的值:输入上限 769,472,或总量上限 854,257。该记录为 2026-03-29 的 gemini-2.5-flash 调用,构成是 prompt 90,016 + completion 13,123 + toolToken 1,937,021——tool token 占 95%,且同一条记录在表中重复出现两行、promptCode 为空。gemini-2.5-flash 的上下文窗口是 1M,2M 的 total 不可能是一次真实上下文。把它写进申请书,Google 会理解成业务需要 2M context window。干净口径有两个,按申请字段的含义选一个:单请求输入上限 max promptToken = 769,472;单请求总量(输入 + 输出 + thinking + tool)上限,剔除 promptCode 为空、或 toolToken 占总量一半及以上的记录后为 854,257(2026-03-29 ~ 09-26 共 276,994,432 次 Gemini 请求,其中 toolToken 占一半及以上的有 249,913 条,占 0.09%)。两个值都在 1M 上下文以内。这批重复的 tool-token 记录本身建议让后端排查埋点。
| Top 3 最大 token 记录 | 模型 | prompt | completion | thinking | tool | total |
|---|---|---|---|---|---|---|
| 2026-03-29(重复 2 行) | gemini-2.5-flash | 90,016 | 13,123 | 0 | 1,937,021 | 2,040,160 |
| 2026-03-19 | gemini-3.1-pro-preview | 1,870 | 97,931 | 391,693 | 1,532,711 | 2,024,205 |
| 2026-04-24 | gemini-2.5-flash | 66,193 | 6,742 | 0 | 1,594,471 | 1,667,406 |
二 · 「当前业务流量仍处于持续增长阶段」与数据相反。Gemini 月度日均:4 月 2.43 M → 8 月 0.87 M,半年下降 58%;9 月回升至 1.01 M,只是从 8 月低点反弹 16%。申请的 400 万/日约为当前实际的 4 倍。按历史峰值申请本身完全合理,但「持续增长」这个理由站不住——Google 调自己那侧的用量记录,看到的是一条下行曲线。建议改为「按半年历史峰值 + 季节性波动预留申请」,并补一句 4 月峰值对应的业务事件与复现可能性。
| Gemini 月度(180 天窗口) | 请求数 | 日均 | token |
|---|---|---|---|
| 2026-03(部分月) | 26,196,374 | 1,871,170 | 87.5 B |
| 2026-04 | 72,862,515 | 2,428,751 | 256.9 B |
| 2026-05 | 52,897,678 | 1,706,377 | 203.6 B |
| 2026-06 | 43,584,673 | 1,452,822 | 173.2 B |
| 2026-07 | 42,891,137 | 1,383,585 | 153.5 B |
| 2026-08 | 26,955,465 | 869,531 | 94.6 B |
| 2026-09(14 天) | 14,116,021 | 1,008,287 | 54.0 B |
三 · 高峰时段偏宽,不是写反。数据记录为北京时间(UTC+8)。180 天实测每小时请求最高在 北京 09–10 时(UTC 01–02),约 1,970 万/小时;最低在 北京 17–18 时(UTC 09–10),约 310 万/小时。申请书的高峰窗口「北京 18:00–次日 14:00 / UTC 10:00–次日 06:00」覆盖了真正的高峰,但把北京 18–22 点和 13 点这 6 个低于平均的小时也算了进去,起点正好是全天最低的 UTC 10 点。实测高于日均的时段是 北京 23:00–次日 13:00(UTC 15:00–次日 05:00):「流量主要集中在夜间和次日上午」成立,「晚间」不成立。
数据记录的是北京时间(UTC+8)。上一版第三点把它当成 UTC,得出「时段写反」,该结论作废,以上文为准。
cachedToken。Gemini 的 TPM 配额确实计入 cached,所以口径没错,但文档里明写一句,可以避免后续与账单对账时口径打架。08 · Requirements