模型指南 · 文本与推理
Claude Haiku 4.5 API 指南
苏姆卡皮 · 文本与推理 · 厂商 Anthropic · Base URL https://sub.sumcapi.top/v1 · 更新于 2026-09-10
30 秒结论
- 它擅长什么:轻量快速的 Claude 档位,适合在线响应敏感的场景,走
/v1/chat/completions一个端点即可开始。 - 怎么接:把 OpenAI SDK 的
base_url改成https://sub.sumcapi.top/v1,api_key换成苏姆卡皮密钥,模型名填Claude Haiku 4.5。 - 注意什么:文本与推理 以控制台与模型广场实时展示为准;生产链路请配置超时、退避与兜底模型。
接口与关键参数
鉴权统一使用 Authorization: Bearer <API_KEY>。流式响应请处理 data: [DONE] 与心跳
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
model | string | 是 | 模型标识,需与模型广场里的名称完全一致 |
messages | array | 是 | [{role, content}] 对话数组,role 取 system / user / assistant / tool |
max_tokens | integer | 否 | 输出上限;不设时上游按默认值截断 |
temperature | number | 否 | 采样温度;抽取与分类建议 0–0.3,创作可提高到 0.8 以上 |
top_p | number | 否 | 核采样,通常只调 temperature 或 top_p 之一 |
stream | boolean | 否 | true 时返回 SSE 流,首个事件即开始计时 |
tools / tool_choice | array / string | 否 | 函数与工具定义;Agent 场景必配超时与重试 |
response_format | object | 否 | 要求 JSON 输出时设为 {"type": "json_object"} |
stop | array | 否 | 停止序列 |
user | string | 否 | 你侧的最终用户标识,便于内部成本归因(不要传明文个人信息) |
请求示例
cURL
curl https://sub.sumcapi.top/v1/chat/completions \
-H "Authorization: Bearer $SUMCAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Claude Haiku 4.5",
"messages": [
{"role": "system", "content": "你是严谨的技术文档助手"},
{"role": "user", "content": "用 5 条要点说明幂等设计"}
],
"max_tokens": 800,
"temperature": 0.3
}'
Python(OpenAI SDK)
from openai import OpenAI
client = OpenAI(base_url="https://sub.sumcapi.top/v1", api_key="sk-你的密钥")
r = client.chat.completions.create(
model="Claude Haiku 4.5",
messages=[{"role": "user", "content": "hello"}],
max_tokens=512,
)
print(r.choices[0].message.content)
响应要点
- 用量字段在
usage中返回(输入、输出、缓存读写分列),账单以此为准。 - 建议记录请求 ID:排查问题与计费争议都需要它。
- 同名模型可能由不同渠道提供,输出风格会有细微差异,切模型前做一轮回归。
常见错误与处理
| 状态码 / 现象 | 通常原因 | 建议处理 |
|---|---|---|
401 | 密钥无效、已停用或余额为 0 | 检查密钥状态与余额;轮换密钥后重新加载配置 |
403 | 模型不在该密钥绑定的分组内 | 换模型,或在控制台把该模型所在分组授予此密钥 |
404 | 模型名或路径不存在 | 先 GET /v1/models 校对可用清单 |
429 | 触发 RPM / 并发 / 配额限制 | 指数退避 1s → 2s → 5s → 10s 并加抖动,不要无脑重试 |
502 / 503 / 504 | 上游暂时不可用或过载 | 网关会自动切换候选渠道;仍失败时切兜底模型并延长超时 |
| 内容策略拒绝 | 提示词命中上游限制 | 改写提示词通常比重试更快;避免真人、品牌与受限题材 |
计费口径
- 按 输入 + 输出 token 计费;思考链与工具调用产生的 token 计入实际消耗。
- 命中缓存的输入 token 单价更低:长系统提示词、长文档问答收益明显。
- 失败请求不计费,
429与网关侧错误不会产生账单条目。 - 公式与争议处理见 模型定价 与 计费与退款政策。
适用场景
- 问答与知识库:配合 嵌入模型 做检索增强,长上下文场景可直接塞入整篇文档。
- 结构化抽取:用 JSON 输出模式加低温采样,把非结构化文本转成稳定字段。
- 内容生产:初稿、改写、多语言版本批量生成,人工只做终审。
- Agent 主干:带
tools的多步编排,限流与故障切换交给网关。
选型建议
客服首 token 延迟敏感、分类路由。同一能力建议同时配置 2 个以上候选模型,网关会在限流与过载时自动切换,见 路由与错误。
接入三步
- 在控制台创建密钥并绑定包含该模型的分组;
- 用上面的示例跑通一次最小请求,确认
messages返回模型名; - 把
model做成配置项,在 模型广场 对照可用清单,逐步迁移业务链路。
相关模型(文本与推理)
| 模型 | 能力 | 定位 |
|---|---|---|
| GPT-5 | 文本与推理 | OpenAI 旗舰对话与推理模型,适合复杂任务拆解、分析与 Agent 主干 |
| GPT-5-mini | 文本与推理 | GPT-5 的小型化版本,覆盖绝大多数日常任务,单位成本明显更低 |
| GPT-5-nano | 文本与推理 | 面向大批量轻任务的轻量模型:分类、打标、抽取、改写 |
| GPT-Audio | 文本与推理 | 音频输入输出的对话模型,适合语音助手与朗读类场景 |
| text-embedding-3-large | 文本与推理 | 高维文本向量模型,用于语义检索、聚类与去重(调用 /v1/embeddings) |
| Claude Sonnet 4.5 | 文本与推理 | Anthropic 主力模型,长文档处理与代码任务表现稳定 |
| Claude Opus 4.5 | 文本与推理 | Anthropic 高能力档位,用于最难的推理与写作任务 |
| Gemini 2.5 Pro | 文本与推理 | Google 旗舰多模态模型,擅长整本书/整段视频级别的长上下文 |
常见问题
Claude Haiku 4.5 可以直接用 OpenAI SDK 调用吗?
可以。把 base_url 设为 https://sub.sumcapi.top/v1、api_key 换成苏姆卡皮密钥即可;如需 Anthropic 原生契约,用 /v1/messages。
模型广场里看不到 Claude Haiku 4.5 怎么办?
说明当前分组未包含该模型或上游暂时未开放。可换一个分组、联系管理员开通,或选择同能力的兜底模型,见 模型广场。
Claude Haiku 4.5 怎么计费?
口径是按 输入 + 输出 token 计费;实际倍率与单价以控制台实时展示为准,详见 模型定价。
调用报 429 怎么处理?
触发的是分组 RPM / 并发限制。按 1s → 2s → 5s 指数退避并加抖动,必要时提高分组限额或增加兜底模型。
苏姆卡皮