Skip to main content
AIHubMix OpenAI 兼容接口深度支持 Claude 思考、缓存与 Beta 功能
我们升级了 OpenAI 兼容接口,针对 Claude 系列模型进行了更深入的适配优化。你可以更精细、更便捷地控制思考(thinking)与缓存(caching)——特别是多轮对话中的交错思考,我们做了更人性化的处理,无需额外传参即可无痛接入。同时支持开启 Anthropic 提供的 beta 功能。

1. 模型思考(Extended Thinking)

1.1 交错思考的优点

未开启交错思考时,模型在一个 assistant turn 中只在开头进行一次思考,后续收到工具结果后直接生成回复,不再产生新的 thinking block:
开启交错思考后,模型在每次收到工具结果时都会插入新的 thinking block,形成链式推理:
这使得模型能够:
  • 基于工具返回结果进行二次推理,而非直接拼接输出
  • 在多次工具调用之间链式推理,每一步决策都建立在上一步的分析之上
参考:Anthropic Interleaved Thinking

1.2 开启思考

支持四种方式,任选其一:
优先级(同时使用多种时):reasoning_effort > reasoning.max_tokens > reasoning.effort > -think 后缀
effort 可选值: minimal / low / medium / high / xhigh

1.3 思考返回

响应的 message 中会增加两个字段:
  • reasoning_content:思考内容(字符串),方便直接展示
  • reasoning_details:思考的完整结构化信息,多轮对话时需要原样回传,内部结构在不同供应商下可能有差异
非流式示例(省略无关字段):
流式返回时,思考内容会通过 delta.reasoning_contentdelta.reasoning_details 逐块下发。完整的流式拼接逻辑见下方完整示例。

1.4 多轮对话中保留思考(已内置交错思考,无需额外传参)

要让模型在多轮对话中延续推理能力,只需将上一轮返回的 reasoning_details 原样放入下一轮的 assistant 消息中:
AihubMix 检测到请求中包含历史思考信息时,会自动开启交错思考(Interleaved Thinking),让模型在收到工具调用结果后继续深度推理,无需额外传参。

1.5 完整示例

以下两个示例演示了完整的多轮 Tool Call + 交错思考流程:用户提问 → 模型思考并调用工具 → 注入工具结果(保留 reasoning_details)→ 模型交错思考后给出最终回复。 非流式 · 交错思考
流式 · 交错思考

1.6 思考强度映射规则

effort 模式:
  • Opus 4.6 / Sonnet 4.6 及以上:映射为 Anthropic 原生的自适应思考(Adaptive Thinking) effort 级别
  • 其他模型:按公式计算 budget_tokens
自适应思考 effort 映射: max_tokens 模式: 直接赋值为 Anthropic 的 budget_tokens -think 后缀: Opus/Sonnet 4.6+ 使用自适应思考(effort=medium);其他模型设 budget_tokens = min(10240, max_tokens - 1)max_tokens 默认 4096。

2. 提示词缓存(Prompt Caching)

你可以在 Chat 接口请求 Claude 模型时使用 Prompt Caching。通过在消息中设置 cache_control 断点,让重复使用的大段文本(角色卡片、RAG 数据、书籍章节等)被缓存下来,后续请求直接命中缓存,大幅降低成本。
Claude 官方文档:Prompt Caching

2.1 缓存价格

2.2 支持的模型与最小缓存长度

断点数量限制: 每个请求最多 4 个 cache_control 断点。

2.3 缓存 TTL

1 小时 TTL 的写入成本更高,但在长时间会话中可通过减少重复写入来节省总费用。所有 Claude 4.5 及之后版本模型的所有提供商(含 Anthropic、Amazon Bedrock、Google Vertex AI)均支持 1 小时 TTL。

2.4 使用方式

systemuser(含图片)、tools 中均可通过 cache_control 字段设置缓存断点。以下示例仅展示关键结构,省略了大段正文内容。 System 消息缓存(默认 5 分钟 TTL):
User 消息缓存(1 小时 TTL):
图片消息缓存:
Tool 定义缓存: cache_control 放在 tool 对象的顶层(与 typefunction 同级):

2.5 缓存状态查看

响应的 usage 中会返回 claude_cache_tokens_details,记录缓存的详细信息: 首次请求(创建缓存):
后续请求(命中缓存):

3. 请求头传递 anthropic-beta

你可以通过 HTTP Header anthropic-beta 来开启 Claude 模型的 beta 特性,AihubMix 会将该 header 透传给 Anthropic API。

用法

在请求头中添加 anthropic-beta,值为对应的 beta 功能标识符:
具体可用的 beta 标识符请参考 Anthropic API 文档

更新时间:2026-06-01
更新时间:2026-06-01