选平台最难的不是信息少,是选择太多。回答下面 3 个问题,直接给你一个**能落地的组合** —— 用哪几家、配哪个客户端、先做哪一步。
下面这张表是本站按 「能查证的免费额度 + 在国内能不能直连 + 能不能跑 Agent」 三个维度预先算好的,急着用可以直接照这个挑;想按自己的情况细选,用下面的推荐器。
| 你要干什么 | 优先选 | 备选 | 为什么 |
|---|---|---|---|
| 日常对话 / 写材料 聊天、总结、翻译、写文案 | 智谱 | 硅基流动、讯飞星火 | 永久免费 / 额度大,适合日常高频 |
| 写代码 / 编程 Agent 要 Tool Calling,要求最高 | InternLM 实测:116,094 token 通过,9.3 秒 | 阿里云百炼、Kimi | 有 OpenAI 兼容端点,且实测扛得住编程 Agent 的上下文 |
| 知识库 / RAG 要 embedding + 长上下文 | 智谱 | 硅基流动、InternLM | 具备 RAG 相关能力 |
| 图像生成 文生图 / 改图 | 智谱 | 硅基流动、InternLM | 支持图像生成 |
| 语音 语音合成 / 识别 | 硅基流动 | 阿里云百炼、TokenHub | 覆盖语音合成或识别 |
| 跑自动化任务 Agent / 工作流 | InternLM 实测:116,094 token 通过,9.3 秒 | 阿里云百炼、Kimi | 实测扛住 11.6 万 token 的 Agent 请求 |
| 维度 | 智谱 GLM | 硅基流动 | InternLM |
|---|---|---|---|
| 免费类型 | 永久免费模型 + 新人 2000 万 tokens(90 天) | 永久免费模型(9 个实测可调) | 每月输入/输出各 9000 万 tokens |
| 代表免费模型 | glm-4.7-flash(200K 上下文) | Qwen3.5-4B(256K,工具调用) | Intern-S2 / 397B 预览版 |
| 限速 | 免费档约 1 并发(社区实测) | L0 档 RPM 1,000 / TPM 50,000 | RPM 30 / TPM 30 万 |
| Agent 大上下文 | 实测通过(12 万 token 单次) | 实测通过(12 万 token 单次,24.1s) | 实测通过(11.6 万 token,9.3s) |
| 适合谁 | 中文日常 + 旗舰限时免费试玩 | 多模型试玩 + 语音/图像 | 重度用量 + 编程 Agent |
Agent 类工具(WorkBuddy、代码编辑器里的 AI)和聊天不一样:它每一轮都会把「系统提示 + 技能 + 工具定义 + 对话历史」完整重发一遍。本站真机实测,一次任务的输入量是这样涨上去的 ——
| 第几跳 | 发送的输入 token | 说明 |
|---|---|---|
| 第 1 跳 | 961 | 刚开任务,上下文还很短 |
| 第 2 跳 | 70,349 | 系统提示、技能、工具定义一次性灌进来,比第一跳涨了 73 倍 |
| 之后 | 9 万上下 | 每轮都维持在这个量级 |
| 平台 | 上下文窗口 | TPM | 跑 Agent | 说明 |
|---|---|---|---|---|
| 阿里云百炼 DashScope | 1M | 5M | 实测通过 116,132 tok 10.3s | 活动期 qwen3.8-flash TPM 提升至 500 万,吃得下 Agent 请求;⚠️ 2026-09-14 站长账号收到欠费通知 —— 活动期免费额度可能已耗尽,以控制台实际余额为准。 |
| TokenHub(腾讯云大模型服务平台) | 未公示 | 1M | 实测通过 120,000 tok 21.7s | TPM 100 万 / RPM 60(2026-09-05 登录实测)—— 16 家里最宽松的一家 |
| Kimi 开放平台(月之暗面) | 1M | 500K | 实测通过 120,000 tok 22.3s | TPM 50 万够用,但免费层 RPM 只有 3 —— 一次 Agent 任务实测要发 6 跳,单独用它两分钟就撞墙 |
| 书生·浦语 InternLM(上海AI实验室) | 256K | 300K | 实测通过 120,000 tok 15.5s | 官方公示 RPM 30 / TPM 30 万,窗口 256K 也够 —— 数据最扎实的一家 |
| 智谱 AI(GLM 系列) | 200K | 未公示 | 实测通过 120,000 tok 47.9s | 窗口够(200K–1M),但官方未公示限速;社区实测免费档并发约 1 —— 一次只能跑一个请求,Agent 多跳会很慢 |
| 讯飞星火 | 8K | 未公示 | 不行 窗口实测只有 8K | ⚠️ 实测窗口只有 8K:发 16K token 即 HTTP 500 TokenOverLimitError,官方标注与实际差 16 倍。Lite 档「token 不限量」指调用量,不是上下文窗口。 |
| 商汤科技(SenseNova / 日日新) | 1M | 未公示 | 实测通过 120,000 tok 6.8s | 窗口 1M,但按积分双池计量(60,000/5h)—— 一次 9 万 token 的请求就吃掉大半配额 |
| 美团 LongCat | 1M | 未公示 | 实测通过 120,000 tok 14.6s | 窗口 1M;限流返 429(retry_after 60s),撞墙要等一分钟 |
| Agnes(爱思) | 512K | 未公示 | 实测通过 120,000 tok 33.3s | 窗口 512K、RPM 30;token 侧限速官方未公示 |
| 七牛云 AI 推理 | 未公示 | 未公示 | 实测通过 120,000 tok 4.1s | 文档未公示窗口与限速(Key 日/月限额默认无限) |
| 快手 StreamLake(万擎 Vanchin) | 1M | 未公示 | 待实测 | 窗口 1M、接入点限流默认「未开启」;官方未公示具体数值 |
| 国家超算互联网 | 1M | 未公示 | 实测通过 120,000 tok 25.4s | 窗口 1M;RPM 按模型在控制台单独配置 |
| 百度智能云千帆(文心) | 80K | 未公示 | 不行 窗口实测 80K | ⚠️ 实测 80K 通过、90K 报 HTTP 400「Prompt tokens too long」;官方报 input limit 125,952,实测低于此。距 9 万门槛差一点。 |
| 火山方舟(豆包) | 未公示 | 未公示 | 待实测 | 每个模型赠 50 万 tokens;窗口与限速官方未公示 |
| 硅基流动 SiliconFlow | 256K | 50K | 实测通过 120,000 tok 24.1s | 官方 L0 档 TPM 5 万,但实测单次 12 万 token 的请求照样通过(24.1s)—— TPM 是每分钟速率限制,不是单次上限;多跳任务撞 429 时自动换家即可。 |
| 模力方舟 Gitee AI | 未公示 | 未公示 | 不行 | 免费体验令牌每日 100 次调用(官方 FAQ 口径)—— 量太小,撑不住 Agent |
对上面标「可以」的 6 家,用各自的 Key 直连官方接口做了阶梯实测(约 80 / 1 万 / 4 万 / 11.6 万 token 四级):
6 家全部通过了最大的 11.6 万 token 一级。最快的是 Google(2.9 秒),窗口最大的是 Mistral(206,368 token)。
最有价值的一条:25 家里 RPM 最低的那家(免费层 RPM 3),窗口完全够、11.6 万 token 也通过了,但第一次测是失败的 —— 报错原文是 request reached organization max RPM: 3。间隔 25 秒重测才通过。
这说明 Agent 场景的第二道墙是 RPM,不是窗口。一次任务要发好几跳请求,RPM 3 意味着每 20 秒只能发一次 —— 所以「一家撞墙自动换一家」不是锦上添花,是能不能用的问题。
16 家里,真机实测能扛住 12 万 token 的有 12 家:腾讯云大模型服务平台、Kimi 开放平台、书生·浦语、智谱、商汤、龙猫、AGNES、七牛、国家超算、openrouter、together、硅基流动。
实测明确扛不住的是:讯飞星火(窗口实测只有 8K)、百度千帆(80K);另有 cloudflare、模力方舟、groq、cerebras 卡在计量方式或每日次数。
标「未公示」的几家不是不能用,是官方没公示限速、无法从文档判断。本站不猜数字:所有结论都来自真 Key 直连发大请求的实测。
去生成一张照抄清单:每家要填的接口地址、模型名、Key 去哪拿都列好,复制进客户端就能用。会用命令行的话,那一页也有让它们自动切换的进阶配置。
去生成照抄清单 →