Nhiều model. Một endpoint.
Dùng một API tương thích, chuyển model mà không phải viết lại phần tích hợp và chỉ trả tiền cho số token thực sự sử dụng.
/api/v1/chat/completions
- Prompt Caching
- Theo dõi chi phí
- Không tự hạ model
glm-5.2$0,0420USD trên 1 triệu input tokengpt-5.6-luna$0,0500USD trên 1 triệu input tokenglm-5.3-flash$0,0555USD trên 1 triệu input tokendeepseek-v4-flash$0,0660USD trên 1 triệu input tokenminimax-m3$0,0900USD trên 1 triệu input tokengpt-5.6-terra$0,1200USD trên 1 triệu input tokenglm-5.3$0,1260USD trên 1 triệu input tokengemini-3.7-flash$0,1350USD trên 1 triệu input tokenqwen3.8-2.4t-a95b$0,1400USD trên 1 triệu input tokenkimi-k3$0,1500USD trên 1 triệu input tokendeepseek-v4-pro$0,1980USD trên 1 triệu input tokengpt-5.6-sol$0,2000USD trên 1 triệu input tokensonnet-5$0,3000USD trên 1 triệu input tokengrok-4.6$0,4000USD trên 1 triệu input tokenopus-5$0,4500USD trên 1 triệu input tokenfable-5$1,5000USD trên 1 triệu input tokenSo sánh bằng con số.
| Tương đối | |||||
|---|---|---|---|---|---|
| GLM 5.2 | 0,0420 | 0,0078 | 0,1320 | 0,05106 | |
| GPT 5.6 Luna | 0,0500 | 0,0050 | 0,3000 | 0,0935 | |
| GLM 5.3 Flash | 0,0555 | 0,0111 | 0,1850 | 0,07067 | |
| DeepSeek V4 Flash 0731 | 0,0660 | 0,0066 | 0,1980 | 0,07392 | |
| MiniMax M3 | 0,0900 | 0,0180 | 0,3600 | 0,1296 | |
Cột Blended giả định 70% input lấy từ cache và output bằng 25% lượng input — đây là mức tham chiếu để so sánh, không phải giá thực tế bị tính. Gateway ghi nhận usage sau response thành công; đây là các mức giá đang được cấu hình.
Chỉ đổi một base URL.
Giữ request format mà ứng dụng đã quen dùng. Khi workload thay đổi, chỉ cần đổi model ID.
một base URL- Chat Completions
POST /chat/completions - Responses
POST /responses - Messages
POST /messages
Cache quyết định hoá đơn.
Tin nhắn thứ 12 của một hội thoại rẻ hơn 3.7 lần so với khi không có cache — vì mỗi tin nhắn đều gửi lại toàn bộ phần trước đó, và chúng tôi chỉ tính giá đầy đủ cho phần mới.
$1,41thay vì $5,17 khi không có cache. Tin nhắn đầu chưa có gì trong cache nên bị tính đủ.
Đơn giá GLM 5.2, USD trên 1 triệu token — cache hit được tính rẻ hơn cache miss 5 lần. Minh hoạ: một hội thoại 12 tin nhắn, mỗi tin nhắn là một request thêm 10.000 input và 1.000 output token rồi gửi lại toàn bộ phần trước đó, quy về 1.000 request. Số token là minh hoạ, đơn giá là giá công bố. Tỷ lệ cache khác nhau theo model.
Trả ít hơn cho từng token.
Chỉ trả cho phần bạn dùng. Giá input bắt đầu từ $0,0420 trên 1 triệu token — giá cache thấp hơn được áp dụng tự động theo từng model.
Giá theo usage · 1.000 credits = $1