🧭 别自己比了,答 3 个问题

我到底该用哪家

选平台最难的不是信息少,是选择太多。回答下面 3 个问题,直接给你一个**能落地的组合** —— 用哪几家、配哪个客户端、先做哪一步。

先看结论:按用途速查

懒得答问题就看这张表

下面这张表是本站按 「能查证的免费额度 + 在国内能不能直连 + 能不能跑 Agent」 三个维度预先算好的,急着用可以直接照这个挑;想按自己的情况细选,用下面的推荐器。

你要干什么优先选备选为什么
日常对话 / 写材料
聊天、总结、翻译、写文案
智谱硅基流动讯飞星火永久免费 / 额度大,适合日常高频
写代码 / 编程 Agent
要 Tool Calling,要求最高
InternLM
实测:116,094 token 通过,9.3 秒
阿里云百炼Kimi有 OpenAI 兼容端点,且实测扛得住编程 Agent 的上下文
知识库 / RAG
要 embedding + 长上下文
智谱硅基流动InternLM具备 RAG 相关能力
图像生成
文生图 / 改图
智谱硅基流动InternLM支持图像生成
语音
语音合成 / 识别
硅基流动阿里云百炼TokenHub覆盖语音合成或识别
跑自动化任务
Agent / 工作流
InternLM
实测:116,094 token 通过,9.3 秒
阿里云百炼Kimi实测扛住 11.6 万 token 的 Agent 请求
「跑自动化任务」那一行的推荐依据是本站真机实测:Agent 类工具每轮都会把系统提示、技能、工具定义和对话历史完整重发,输入量会从第一跳的 961 token 涨到 9 万上下。16 家里官方数据能确认扛得住的只有 6 家,实测全部通过。

① 场景推荐器

30 秒出结果

② 并排对比

勾选 2–4 家(已选 0
不想动手?下面是一组预置对比(三家常青款,核实于 2026-09-16)——在上方勾选 2–4 家,你的专属对比会出现在表格下方。
维度智谱 GLM硅基流动InternLM
免费类型永久免费模型 + 新人 2000 万 tokens(90 天)永久免费模型(9 个实测可调)每月输入/输出各 9000 万 tokens
代表免费模型glm-4.7-flash(200K 上下文)Qwen3.5-4B(256K,工具调用)Intern-S2 / 397B 预览版
限速免费档约 1 并发(社区实测)L0 档 RPM 1,000 / TPM 50,000RPM 30 / TPM 30 万
Agent 大上下文实测通过(12 万 token 单次)实测通过(12 万 token 单次,24.1s)实测通过(11.6 万 token,9.3s)
适合谁中文日常 + 旗舰限时免费试玩多模型试玩 + 语音/图像重度用量 + 编程 Agent

③ 跑 Agent:哪家扛得住

这一节是全站最硬的数据

Agent 类工具(WorkBuddy、代码编辑器里的 AI)和聊天不一样:它每一轮都会把「系统提示 + 技能 + 工具定义 + 对话历史」完整重发一遍。本站真机实测,一次任务的输入量是这样涨上去的 ——

第几跳发送的输入 token说明
第 1 跳961刚开任务,上下文还很短
第 2 跳70,349系统提示、技能、工具定义一次性灌进来,比第一跳涨了 73 倍
之后9 万上下每轮都维持在这个量级
所以「能不能跑 Agent」要两条同时满足:① 上下文窗口 ≥ 9 万 token;② TPM ≥ 9 万
⚠️ TPM 约束的是每分钟频率(撞了返 429),不是单次能不能过的门槛 —— 实测某家声明 TPM 5 万,单次 12 万 token 的请求照样通过。
平台上下文窗口TPM跑 Agent说明
阿里云百炼 DashScope1M5M实测通过
116,132 tok
10.3s
活动期 qwen3.8-flash TPM 提升至 500 万,吃得下 Agent 请求;⚠️ 2026-09-14 站长账号收到欠费通知 —— 活动期免费额度可能已耗尽,以控制台实际余额为准。
TokenHub(腾讯云大模型服务平台)未公示1M实测通过
120,000 tok
21.7s
TPM 100 万 / RPM 60(2026-09-05 登录实测)—— 16 家里最宽松的一家
Kimi 开放平台(月之暗面)1M500K实测通过
120,000 tok
22.3s
TPM 50 万够用,但免费层 RPM 只有 3 —— 一次 Agent 任务实测要发 6 跳,单独用它两分钟就撞墙
书生·浦语 InternLM(上海AI实验室)256K300K实测通过
120,000 tok
15.5s
官方公示 RPM 30 / TPM 30 万,窗口 256K 也够 —— 数据最扎实的一家
智谱 AI(GLM 系列)200K未公示实测通过
120,000 tok
47.9s
窗口够(200K–1M),但官方未公示限速;社区实测免费档并发约 1 —— 一次只能跑一个请求,Agent 多跳会很慢
讯飞星火8K未公示不行
窗口实测只有 8K
⚠️ 实测窗口只有 8K:发 16K token 即 HTTP 500 TokenOverLimitError,官方标注与实际差 16 倍。Lite 档「token 不限量」指调用量,不是上下文窗口。
商汤科技(SenseNova / 日日新)1M未公示实测通过
120,000 tok
6.8s
窗口 1M,但按积分双池计量(60,000/5h)—— 一次 9 万 token 的请求就吃掉大半配额
美团 LongCat1M未公示实测通过
120,000 tok
14.6s
窗口 1M;限流返 429(retry_after 60s),撞墙要等一分钟
Agnes(爱思)512K未公示实测通过
120,000 tok
33.3s
窗口 512K、RPM 30;token 侧限速官方未公示
七牛云 AI 推理未公示未公示实测通过
120,000 tok
4.1s
文档未公示窗口与限速(Key 日/月限额默认无限)
快手 StreamLake(万擎 Vanchin)1M未公示待实测窗口 1M、接入点限流默认「未开启」;官方未公示具体数值
国家超算互联网1M未公示实测通过
120,000 tok
25.4s
窗口 1M;RPM 按模型在控制台单独配置
百度智能云千帆(文心)80K未公示不行
窗口实测 80K
⚠️ 实测 80K 通过、90K 报 HTTP 400「Prompt tokens too long」;官方报 input limit 125,952,实测低于此。距 9 万门槛差一点。
火山方舟(豆包)未公示未公示待实测每个模型赠 50 万 tokens;窗口与限速官方未公示
硅基流动 SiliconFlow256K50K实测通过
120,000 tok
24.1s
官方 L0 档 TPM 5 万,但实测单次 12 万 token 的请求照样通过(24.1s)—— TPM 是每分钟速率限制,不是单次上限;多跳任务撞 429 时自动换家即可。
模力方舟 Gitee AI未公示未公示不行免费体验令牌每日 100 次调用(官方 FAQ 口径)—— 量太小,撑不住 Agent

本站真机复测(2026-09-13)

对上面标「可以」的 6 家,用各自的 Key 直连官方接口做了阶梯实测(约 80 / 1 万 / 4 万 / 11.6 万 token 四级):

6 家全部通过了最大的 11.6 万 token 一级。最快的是 Google(2.9 秒),窗口最大的是 Mistral(206,368 token)。

最有价值的一条:25 家里 RPM 最低的那家(免费层 RPM 3),窗口完全够、11.6 万 token 也通过了,但第一次测是失败的 —— 报错原文是 request reached organization max RPM: 3。间隔 25 秒重测才通过。
这说明 Agent 场景的第二道墙是 RPM,不是窗口。一次任务要发好几跳请求,RPM 3 意味着每 20 秒只能发一次 —— 所以「一家撞墙自动换一家」不是锦上添花,是能不能用的问题。

结论

16 家里,真机实测能扛住 12 万 token 的有 12 家:腾讯云大模型服务平台、Kimi 开放平台、书生·浦语、智谱、商汤、龙猫、AGNES、七牛、国家超算、openrouter、together、硅基流动。

实测明确扛不住的是:讯飞星火(窗口实测只有 8K)、百度千帆(80K);另有 cloudflare、模力方舟、groq、cerebras 卡在计量方式或每日次数。

标「未公示」的几家不是不能用,是官方没公示限速、无法从文档判断。本站不猜数字:所有结论都来自真 Key 直连发大请求的实测。

数据取自各平台官方限速页/文档页,或本站已人工核实的字段;标「实测通过」的是 2026-09-14 用真 Key 直连各官方接口、单次发 9 万 / 12 万 token 大请求跑出来的结果。限速随时可能调整,以官方页为准。

选好了?下一步是把它填进客户端

去生成一张照抄清单:每家要填的接口地址、模型名、Key 去哪拿都列好,复制进客户端就能用。会用命令行的话,那一页也有让它们自动切换的进阶配置。

去生成照抄清单 →