首页 / 模型指南 / Llama 4

模型指南 · 文本与推理

Llama 4 API 指南

苏姆卡皮 · 文本与推理 · 厂商 Meta · Base URL https://sub.sumcapi.top/v1 · 更新于 2026-09-10

30 秒结论

接口与关键参数

鉴权统一使用 Authorization: Bearer <API_KEY>。流式响应请处理 data: [DONE] 与心跳

参数类型必填说明
modelstring模型标识,需与模型广场里的名称完全一致
messagesarray[{role, content}] 对话数组,rolesystem / user / assistant / tool
max_tokensinteger输出上限;不设时上游按默认值截断
temperaturenumber采样温度;抽取与分类建议 0–0.3,创作可提高到 0.8 以上
top_pnumber核采样,通常只调 temperaturetop_p 之一
streambooleantrue 时返回 SSE 流,首个事件即开始计时
tools / tool_choicearray / string函数与工具定义;Agent 场景必配超时与重试
response_formatobject要求 JSON 输出时设为 {"type": "json_object"}
stoparray停止序列
userstring你侧的最终用户标识,便于内部成本归因(不要传明文个人信息)

请求示例

cURL

curl https://sub.sumcapi.top/v1/chat/completions \
  -H "Authorization: Bearer $SUMCAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Llama 4",
    "messages": [
      {"role": "system", "content": "你是严谨的技术文档助手"},
      {"role": "user", "content": "用 5 条要点说明幂等设计"}
    ],
    "max_tokens": 800,
    "temperature": 0.3
  }'

Python(OpenAI SDK)

from openai import OpenAI

client = OpenAI(base_url="https://sub.sumcapi.top/v1", api_key="sk-你的密钥")
r = client.chat.completions.create(
    model="Llama 4",
    messages=[{"role": "user", "content": "hello"}],
    max_tokens=512,
)
print(r.choices[0].message.content)

响应要点

常见错误与处理

状态码 / 现象通常原因建议处理
401密钥无效、已停用或余额为 0检查密钥状态与余额;轮换密钥后重新加载配置
403模型不在该密钥绑定的分组内换模型,或在控制台把该模型所在分组授予此密钥
404模型名或路径不存在GET /v1/models 校对可用清单
429触发 RPM / 并发 / 配额限制指数退避 1s → 2s → 5s → 10s 并加抖动,不要无脑重试
502 / 503 / 504上游暂时不可用或过载网关会自动切换候选渠道;仍失败时切兜底模型并延长超时
内容策略拒绝提示词命中上游限制改写提示词通常比重试更快;避免真人、品牌与受限题材

计费口径

适用场景

选型建议

多语言任务、私有化对照基线。同一能力建议同时配置 2 个以上候选模型,网关会在限流与过载时自动切换,见 路由与错误

接入三步

  1. 在控制台创建密钥并绑定包含该模型的分组;
  2. 上面的示例跑通一次最小请求,确认 messages 返回模型名;
  3. model 做成配置项,在 模型广场 对照可用清单,逐步迁移业务链路。

相关模型(文本与推理)

模型能力定位
GPT-5文本与推理OpenAI 旗舰对话与推理模型,适合复杂任务拆解、分析与 Agent 主干
GPT-5-mini文本与推理GPT-5 的小型化版本,覆盖绝大多数日常任务,单位成本明显更低
GPT-5-nano文本与推理面向大批量轻任务的轻量模型:分类、打标、抽取、改写
GPT-Audio文本与推理音频输入输出的对话模型,适合语音助手与朗读类场景
text-embedding-3-large文本与推理高维文本向量模型,用于语义检索、聚类与去重(调用 /v1/embeddings)
Claude Sonnet 4.5文本与推理Anthropic 主力模型,长文档处理与代码任务表现稳定
Claude Opus 4.5文本与推理Anthropic 高能力档位,用于最难的推理与写作任务
Claude Haiku 4.5文本与推理轻量快速的 Claude 档位,适合在线响应敏感的场景

想看全部能力入口,见 模型指南能力与场景

免费开始查看可用模型模型定价

常见问题

Llama 4 可以直接用 OpenAI SDK 调用吗?

可以。把 base_url 设为 https://sub.sumcapi.top/v1、api_key 换成苏姆卡皮密钥即可;如需 Anthropic 原生契约,用 /v1/messages

模型广场里看不到 Llama 4 怎么办?

说明当前分组未包含该模型或上游暂时未开放。可换一个分组、联系管理员开通,或选择同能力的兜底模型,见 模型广场

Llama 4 怎么计费?

口径是按 输入 + 输出 token 计费;实际倍率与单价以控制台实时展示为准,详见 模型定价

调用报 429 怎么处理?

触发的是分组 RPM / 并发限制。按 1s → 2s → 5s 指数退避并加抖动,必要时提高分组限额或增加兜底模型。