GLM 5.3 Flash
高性價比的多模態 GLM-5,1M 上下文,適合編碼與 Agent 工作流程。
Z.AI 的 Flash 檔開源模型。1M token 上下文,原生支援文字、圖像和影片輸入,混合稀疏注意力兼顧長上下文精度和成本,適合長上下文編碼和 Agent 工作流程。
模型 ID
glm-5.3-flash上下文
1M
最大輸出
48K
延遲
快
協議
chat-completions
模型價格
| 項目 | 輸入 / 100 萬 | 輸出 / 100 萬 | 快取讀 / 100 萬 | 快取寫 / 100 萬 |
|---|---|---|---|---|
| 標準 | $0.15 | $0.50 | $0.03 | Not published |
價格以美元計,按每 100 萬 tokens 顯示。快取價格僅在協議回應包含快取用量時適用。破折號表示沒有單獨公布的費率。
填入 API key
從 Felo API Platform 帳戶建立 key,並設定為環境變數。
export FELO_API_KEY="YOUR_API_KEY"發出第一次請求
使用該模型 ID 呼叫 Felo API Platform endpoint。可選請求標頭如 glm-5.3-flash 能協助排查問題。 X-Request-Id
該模型支援推理。如果所選協議與模型路由提供推理控制,請在繼續對話時保留回傳的推理中繼資料。
const response = await fetch("https://openapi.felo.ai/api/v1/chat/completions", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.FELO_API_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "glm-5.3-flash",
messages: [
{ role: "user", content: "How many r's are in the word strawberry?" }
],
}),
});
const data = await response.json();
console.log(data.choices[0].message.content);使用第三方 SDK
兼容 SDK 只需把 baseURL 设置为 baseURL https://openapi.felo.ai/api/v1. Claude 风格客户端使用 Anthropic-compatible base URL。 https://openapi.felo.ai/api.
啟用串流輸出
加入 stream: true,即可以 server-sent events 接收回應。
curl -N https://openapi.felo.ai/api/v1/chat/completions -H "Authorization: Bearer $FELO_API_KEY" -H "Content-Type: application/json" -d '{
"model": "glm-5.3-flash",
"stream": true,
"messages": [
{"role": "user", "content": "Hello"}
]
}'Endpoint
Felo API Platform 提供兼容的模型调用入口。选择你的应用或 Agent 客户端已经支持的接口即可。
Chat Completions
Chat completion requests for compatible apps and agents.
POST
https://openapi.felo.ai/api/v1/chat/completionsResponses
Responses-compatible agent and workflow requests.
POST
https://openapi.felo.ai/api/v1/responsesMessages
Anthropic-compatible messages for Claude-style clients.
POST
https://openapi.felo.ai/api/v1/messages参数
modelstringglm-5.3-flashPublic model ID to call.messagesarrayrequiredConversation messages for Chat Completions.streambooleanfalseReturn server-sent events when true.temperaturenumber1Controls response variety when supported.max_tokensintegermodel defaultMaximum generated tokens.toolsarrayoptionalTool calling definitions following compatible schema.tool_choicestring or objectoptionalControls whether a tool should be called.response_formatobjectoptionalRequest structured output when supported.