Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.078 — 2026-09-20
REPO 约 1 分钟

GLM-5.3推出200 token/s版本

GLM-5.3-FlashX标称最高200 token/s,为实时Agent和高并发任务提供新选项。

IMAGE — OpenRouter 新模型上架

让 AI 一边看图或视频,一边执行多步任务,最影响体验的往往不只是它答得对不对,还有文字能不能及时生成。Z.ai 推出的 GLM-5.3-FlashX,正是 GLM-5.3-Flash 的高速版本。OpenRouter 页面称其推理速度最高可达 200 token/s——也就是每秒生成约 200 个文本片段,等待感通常会更弱。

它是一款原生多模态模型,可在同一套模型中接收文字、图像和视频,再输出文字。模型共有 3200 亿参数,但每次生成只激活 180 亿;这种“稀疏”设计意在减少单个 token 的计算量。它还提供约 100 万 token 的上下文窗口,面向编程、视觉理解和长流程 Agent 等任务。

不过,200 token/s 是页面给出的“最高”速度,并非所有请求都能达到。该页同时显示,最佳服务商的吞吐量中位数为 74 token/s;输入长度和服务条件不同,速度也不能直接横比。


供稿材料 SOURCES — 1
01
Z.ai: GLM 5.3 FlashX OpenRouter 新模型上架 · REPO
原文 ↗

← 返回 2026-09-20 · 开源板块