GLM 5.3 Flash
高性价比的多模态 GLM-5,1M 上下文,适合编码与 Agent 工作流。
Z.AI 的 Flash 档开源模型。1M token 上下文,原生支持文字、图像和视频输入,混合稀疏注意力兼顾长上下文精度和成本,适合长上下文编码和 Agent 工作流。
模型 ID
glm-5.3-flash上下文
1M
最大输出
48K
延迟
快
协议
chat-completions
模型价格
| 项目 | 输入 / 100 万 | 输出 / 100 万 | 缓存读 / 100 万 | 缓存写 / 100 万 |
|---|---|---|---|---|
| 标准 | $0.15 | $0.50 | $0.03 | Not published |
价格以美元计,按每 100 万 tokens 展示。缓存价格仅在协议响应包含缓存用量时适用。破折号表示没有单独公布的费率。
填入 API key
从 Felo API Platform 账户创建 key,并设置为环境变量。
export FELO_API_KEY="YOUR_API_KEY"发起第一次请求
使用该模型 ID 调用 Felo API Platform endpoint。可选请求头如 glm-5.3-flash 能帮助排查问题。 X-Request-Id
该模型支持推理。如果所选协议和模型路由暴露推理控制,请在继续对话时保留返回的推理元数据。
const response = await fetch("https://openapi.felo.ai/api/v1/chat/completions", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.FELO_API_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "glm-5.3-flash",
messages: [
{ role: "user", content: "How many r's are in the word strawberry?" }
],
}),
});
const data = await response.json();
console.log(data.choices[0].message.content);使用第三方 SDK
兼容 SDK 只需把 baseURL 设置为 baseURL https://openapi.felo.ai/api/v1. Claude 风格客户端使用 Anthropic-compatible base URL。 https://openapi.felo.ai/api.
启用流式输出
加入 stream: true,即可以 server-sent events 接收响应。
curl -N https://openapi.felo.ai/api/v1/chat/completions -H "Authorization: Bearer $FELO_API_KEY" -H "Content-Type: application/json" -d '{
"model": "glm-5.3-flash",
"stream": true,
"messages": [
{"role": "user", "content": "Hello"}
]
}'Endpoint
Felo API Platform 提供兼容的模型调用入口。选择你的应用或 Agent 客户端已经支持的接口即可。
Chat Completions
Chat completion requests for compatible apps and agents.
POST
https://openapi.felo.ai/api/v1/chat/completionsResponses
Responses-compatible agent and workflow requests.
POST
https://openapi.felo.ai/api/v1/responsesMessages
Anthropic-compatible messages for Claude-style clients.
POST
https://openapi.felo.ai/api/v1/messages参数
modelstringglm-5.3-flashPublic model ID to call.messagesarrayrequiredConversation messages for Chat Completions.streambooleanfalseReturn server-sent events when true.temperaturenumber1Controls response variety when supported.max_tokensintegermodel defaultMaximum generated tokens.toolsarrayoptionalTool calling definitions following compatible schema.tool_choicestring or objectoptionalControls whether a tool should be called.response_formatobjectoptionalRequest structured output when supported.