> ## Documentation Index
> Fetch the complete documentation index at: https://docs.aihubmix.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 更新日志

> AIHubMix 更新日志：实时跟踪平台新接入的 GPT、Claude、Gemini、Qwen、DeepSeek 等模型与功能更新，第一时间掌握最新模型支持、能力升级与平台动态。

## 2026 年

### 08 月 10 日

**媒体生成累计用量统计更完整**

* 媒体生成任务完成结算后，会同步补记账号累计已用额度。用户在控制台查看累计已用、余额扣减和消费记录时，媒体生成部分会更完整地反映真实用量。

**Azure 点号模型名兼容性提升**

* 调用 deployment/model 名中包含点号的 Azure 模型时，模型名在 Chat、Responses 和 Messages 转换链路中保持原样，不再被自动改写；既有 Azure 调用行为保持不变。

### 08 月 08 日

**新增视频生成模型**

* 新增 [`doubao-seedance-2-5-260628`](https://aihubmix.com/model/doubao-seedance-2-5-260628)：ByteDance Seed 新一代统一多模态音视频生成模型，可一次生成最长 30 秒的音视频同步内容，并支持多轮延展。相比 Seedance 2.0，它在叙事、转场、参考素材支持、真实感和精准编辑方面进一步提升，适合影视制作、广告、教育、仿真和长内容创作。

### 08 月 06 日

**新增模型**

* 新增 [`wan3.0-video`](https://aihubmix.com/model/wan3.0-video)：阿里通义实验室推出的一体化视频生成与编辑模型，目前处于公测阶段。它支持最长 30 秒的原生视频生成、生产级角色一致性、逼真的画面与声音，以及统一的参考生成、编辑、复刻和动作驱动工作流，适合广告、电商、影视制作、角色动画、视频编辑和文档转视频。
* 新增 [`qwen-image-3.0`](https://aihubmix.com/model/qwen-image-3.0)：阿里云通义千问团队的图像生成与编辑模型，支持文生图、参考图创作和图像编辑。兼顾画质与速度，适合社交媒体、电商、创意设计、日常内容生产以及高频大规模创作。
* 新增 [`qwen-image-3.0-pro`](https://aihubmix.com/model/qwen-image-3.0-pro)：阿里云通义千问旗舰级图像生成与编辑模型，面向广告、品牌视觉、UI、演示、产品图和专业设计场景。擅长复杂版式、精准的中英文字渲染、真实材质、参考图编辑，以及细节、构图和商业级视觉品质。

### 08 月 04 日

**Gemini embedding 支持多模态输入与分模态计费**

* `gemini-embedding-2-preview` 现在可以通过 OpenAI 兼容 embeddings 入口和 Gemini 原生入口处理文本、图片、音频、视频和文档输入。使用多模态向量检索、内容理解或知识库构建的用户，可在同一模型上接入更多输入类型。
* Gemini embedding 的费用会优先按模型推理厂商返回的分模态 token 用量计算；图片、音频、视频和文档不再被统一当作文本估算。多模态 embedding 账单更贴近真实用量。
* 单条 embedding 请求可直接使用新一代 Gemini embedding；包含多条输入的批量请求会明确返回能力不支持的提示。

**Seedance 2.0 视频生成调用更稳定**

* Seedance 2.0 的图片、音频、视频等引用会按媒体类型更准确地映射，`adaptive`、4K、尺寸等能力约束更清晰。视频生成工作流中因参数映射不准导致的失败会减少。
* 自适应时长请求会先按 15 秒预扣，并在任务完成后按真实时长结算；用户余额预扣和最终账单更一致。
* 媒体生成失败时，接口会返回脱敏后的错误信息，方便用户和客服定位参数、签名链接或模型推理厂商限制问题，同时避免暴露敏感凭证。

### 08 月 03 日

**新增模型**

* 新增 [`qwen3.8-max`](https://aihubmix.com/model/qwen3.8-max)：阿里云旗舰原生视觉语言模型，基于 2.4 万亿参数的 Mixture-of-Experts (MoE) 架构，最大上下文窗口达 100 万 tokens。适合复杂多模态理解、高阶推理、软件开发、agent 工作流以及长上下文处理。与 Qwen3.7-Max 价格相近，在推理、编码和 agent 能力上均有明显提升，整体表现对齐当前主流领先模型。

**模型详情中的供应商可用性更清晰**

* 模型详情会优先展示当前更适合调用的供应商，并把仅作备用或暂不可用的供应商放到后面。用户选择模型供应商、客服排查模型可用性时，可以更直观看到哪些供应商当前更适合使用，减少因展示顺序过期带来的误判。

### 08 月 02 日

**小额账单与消费日志更准确**

* by-bill 计费模型的小额请求不再因为取整归零而缺少扣费和消费日志。受影响的请求会按最小有效额度入账，用户账单、余额预扣和消费记录更一致；客服和运营排查小额 embedding 等高频请求时，可以看到更完整的记录。

### 07 月 31 日

**新增模型**

* 新增 [`deepseek-v4-flash`](https://aihubmix.com/model/deepseek-v4-flash)：面向效率优化的 Mixture-of-Experts 模型，总参数 284B，激活参数 13B，上下文窗口 100 万 tokens。为快速推理和高吞吐场景设计，同时保留强劲的推理与编码能力，适合编码助手、聊天系统和 agent 工作流。

**新增视频生成模型**

* 新增 [`minimax-h3`](https://aihubmix.com/model/minimax-h3)：MiniMax 的通用多模态视频模型，支持文本、图像、音频和视频输入，可用于文生视频、图生视频、首尾帧生成、参考素材生成和视频编辑。需要搭建视频创作、广告素材、产品演示或多模态内容工作流的用户，可以通过 AIHubMix 统一接口接入。

**GLM-5.2 分时段限时特惠**

* `glm-5.2` 调用价格按每日时段打折，时间以 UTC 为准：每日 14:00 至 24:00 享 5 折，每日 00:00 至 14:00 享 7 折。活动限时。

**GPT-5.6 Luna/Terra 价格下调**

* `gpt-5.6-luna` 已同步官方降价 80%，当前价格为输入 $0.20、输出 $1.20；`gpt-5.6-terra` 已同步官方降价 20%，当前价格为输入 $2.00、输出 $12.00。对这两个模型有稳定调用量的用户，可重新评估成本敏感和通用任务的模型选择。

### 07 月 30 日

**AIHubMix 官方 MCP Server 上线**

* 新增面向 MCP 客户端的官方托管入口 [mcp.aihubmix.com/mcp](https://mcp.aihubmix.com/mcp) 或 [mcp.inferera.com/mcp](https://mcp.inferera.com/mcp)。支持在 Claude Code、Codex、Cursor 等工具中通过同一入口查询模型与价格、检索文档、查看余额，并调用聊天、图像生成和视频生成等工具能力。
* MCP 请求凭证由客户端逐次传入，服务端不保存 API Key；适合希望在 IDE 或 Agent 工具里直接使用 AIHubMix 模型和媒体能力的开发者。

### 07 月 29 日

**新增模型**

* 新增 [`jina-reranker-v3.5`](https://aihubmix.com/model/jina-reranker-v3.5)：Jina AI 的 0.6B 多语言 listwise 文档重排模型，可作为 `jina-reranker-v3` 的同接口升级版本。它面向 RAG、搜索和结构化资料排序场景，支持长上下文候选排序，并提升领域鲁棒性、多语言检索、结构化数据排序和推理效率。

### 07 月 28 日

**缓存计费更准确**

* 对显式缓存与隐式缓存请求，平台会更一致地识别缓存读写用量，并按实际返回的缓存类型优先计费。使用 Qwen、Claude 等支持缓存能力的用户，可获得更贴近真实用量的账单明细。

**媒体生成与任务结果稳定性提升**

* 媒体生成首批模型列表收窄到已验证模型，并修复部分图像模型经媒体入口调用时可能 404 的问题。控制台中的 LLM 任务下载也补齐了文本存档场景，历史大结果更容易下载和交付。

**站点与模型数据刷新更可靠**

* 官网、模型数据、博客数据和站点地图的缓存策略已调整为发布后更快生效；模型广场与文档入口在内容更新后更不容易被旧缓存影响。

### 07 月 27 日

**媒体生成接口上线**

* 新增 `/ai/v1/images/generations` 与 `/ai/v1/images/edits` 媒体生成入口，并提供统一的异步任务、结果查询、产物下载和 webhook 回调能力。图像与视频类工作流可以通过同一套任务生命周期接入，便于客户端跟踪长耗时生成结果。
* 生成产物会通过 AIHubMix 统一任务结果返回，并支持受限次数的下载与批量获取。运营和客服可重点关注首批用户的任务状态、下载链接有效性和计费明细反馈。

### 07 月 25 日

**新增模型**

* 新增 [`claude-opus-5`](https://aihubmix.com/model/claude-opus-5)：Anthropic 旗舰模型，面向高强度推理、编码和长程 agent 任务。擅长端到端软件开发、代码审查与缺陷发现、图表与文档视觉分析、复杂办公交付以及并行子代理协作，具备 1M 上下文窗口，最大输出 128K。

### 07 月 24 日

**新增模型**

* 新增 [`mai-image-2.5-pro`](https://aihubmix.com/model/mai-image-2.5-pro)：微软旗舰级图像生成与编辑模型，具备高保真写实效果、精准的图内文字渲染以及强大的图像编辑能力，适合商业设计、产品摄影和专业创意工作流。
* 新增 [`qwen-audio-3.0-tts-flash`](https://aihubmix.com/model/qwen-audio-3.0-tts-flash)：通义千问实时语音合成模型，支持更多低资源语言与中文方言，具备丰富的表现力控制，首包延迟低于 200 ms，适合语音助手、实时对话和智能客服。
* 新增 [`qwen-audio-3.0-tts-plus`](https://aihubmix.com/model/qwen-audio-3.0-tts-plus)：通义千问高品质语音合成模型，可精细控制情感、语气、角色、语速、音量与合成风格，并在噪声和混响环境下更稳定，适合内容创作、有声书、影视配音、品牌声音设计及高品质语音服务。

**Qwen TTS 音频生成能力**

* 两个 Qwen TTS 模型均可通过 `/v1/audio/speech` 调用；非流式请求返回音频结果链接，流式请求返回 SSE 音频生成事件。下表结合 AIHubMix 兼容字段与阿里云官方 Qwen-Audio-TTS 口径整理；`voice` 需按模型分别选择，plus 与 flash 的系统音色不可混用。

| 能力项                    | `qwen-audio-3.0-tts-plus`                                            | `qwen-audio-3.0-tts-flash`                                                              |
| ---------------------- | -------------------------------------------------------------------- | --------------------------------------------------------------------------------------- |
| 输入文本 `input`           | 必填，AIHubMix 兼容入口单次不超过 4096 字符；文本内可嵌入 `[excited]`、`[laughing]` 等情感标签。 | 必填，AIHubMix 兼容入口单次不超过 4096 字符；文本内可嵌入 `[excited]`、`[laughing]` 等情感标签。                    |
| 音色 `voice`             | 系统音色：`longanlingxin`、`longanlufeng`；另有 500+ 基础/克隆音色。                 | 系统音色：`longanhuan_v3.6`、`longjielidou_v3.6`、`loongeva_v3.6`、`loongjohn`；另有 500+ 基础/克隆音色。 |
| 输出格式 `response_format` | 默认 `mp3`，也支持 `wav`、`pcm`、`opus`；暂不支持 `aac`/`flac`。                   | 默认 `mp3`，也支持 `wav`、`pcm`、`opus`；暂不支持 `aac`/`flac`。                                      |
| 语速 `speed`             | 支持 `0.5` 到 `2.0`，默认 `1.0`。                                           | 支持 `0.5` 到 `2.0`，默认 `1.0`。                                                              |
| 口播指令 `instructions`    | 支持用自然语言控制角色、情绪和口音，例如“用温柔的语气”。                                        | 支持用自然语言控制角色、情绪和口音，例如“用温柔的语气”。                                                           |
| 流式 `stream_format`     | 非流式可不传，返回 URL JSON；流式传 `sse`，返回 SSE 事件。                              | 非流式可不传，返回 URL JSON；流式传 `sse`，返回 SSE 事件。                                                 |

**Messages 响应兼容性提升**

* 通过 `/v1/messages` 调用桥接模型或 Claude/Bedrock 等模型服务时，响应字段与 Anthropic Messages 生态更一致，减少严格 SDK 或校验器因缺少响应字段而报错的情况。

**AWS Bedrock 流式断连后的用量更完整**

* 客户端中途断开 AWS Bedrock 流式请求时，平台会继续收口模型推理厂商结束信号和最终 usage，减少断连场景下请求日志、结算明细和实际模型推理厂商用量不一致的情况。

### 07 月 23 日

**新增模型**

* 新增 [`qwen3-coder-480b-a35b-instruct`](https://aihubmix.com/model/qwen3-coder-480b-a35b-instruct)：Qwen3-Coder 旗舰代码模型，面向代码生成、软件工程 Agent 和工具调用工作流，适合长上下文代码理解与自动化开发任务。
* 新增 [`gemini-2.5-flash-lite`](https://aihubmix.com/model/gemini-2.5-flash-lite)：Google 2.5 系列轻量模型，面向低延迟、低成本的高频文本、多模态和批处理场景。
* 新增 [`Qwen/Qwen3-235B-A22B-Instruct-2507`](https://aihubmix.com/model/Qwen/Qwen3-235B-A22B-Instruct-2507)：Qwen3 235B-A22B Instruct 2507 版本，适合通用对话、指令跟随、多语种与长上下文任务。

### 07 月 22 日

**新增模型**

* 新增 [`gemini-3.6-flash`](https://aihubmix.com/model/gemini-3.6-flash)：Google 最新 Flash 系列模型，适合复杂工作流、计算机使用、图表推理和长上下文任务。
* 新增 [`gemini-3.5-flash-lite`](https://aihubmix.com/model/gemini-3.5-flash-lite)：更轻量、低成本的 3.5 系列模型，适合高吞吐、日常自动化和批量处理场景。
* 新增 [`glm-5.2-fast-preview`](https://aihubmix.com/model/glm-5.2-fast-preview)：智谱 GLM-5.2 系列快速预览模型，适合低延迟对话、快速推理和高吞吐应用场景。

**Qwen 3.8 流式请求稳定性提升**

* 通过 `/v1/responses` 和 `/v1/messages` 调用 `qwen3.8-max-preview` 的流式请求更稳定；此前可能被误判为 `empty_stream` 或 502 的有效流式响应，现在可正常完成。

### 07 月 21 日

**Gemini 图像参数透传**

* 通过 OpenAI 兼容的 Chat Completions 调用 Gemini/Vertex 图像输出模型时，现在可在 `extra_body.generationConfig.imageConfig` 中传递 `aspectRatio` 和 `imageSize`。

**Gemini embedding 计费更贴近真实用量**

* Gemini embedding 响应提供真实 `usageMetadata` 时，平台会优先按模型推理厂商返回的 token 用量计费；缺失时仍保留原本地估算兜底。

**Responses 动态工具兼容性提升**

* `/v1/responses` 请求中的 system/developer 消息现在可携带 message-local function tools，并在桥接到 Chat 模型时保留工具声明。依赖 Kimi K3 等动态工具工作流的客户端，工具调用链路更稳定。

**Responses stop 参数修复**

* 通过 `/v1/responses` 调用会桥接到 Chat 的模型时，`stop` 现在会随请求传给模型推理厂商。单个停止词可正常生效，超过模型推理厂商限制的数量或长度会返回与 Chat Completions 一致的边界错误。

**DeepSeek V4 分时段计费支持**

* DeepSeek V4 相关模型可按配置支持峰谷分时段计费；预扣与最终结算使用同一请求提交时间口径，跨峰谷边界的流式请求也按提交时刻计价。预扣保护仅作用于配置了分时段计费的模型，避免影响其他普通模型的余额冻结体验。

### 07 月 20 日

**Claude Messages thinking 兼容性修复**

* 通过 `/v1/messages` 调用 OpenAI/Azure Chat 桥接模型时，Claude `thinking` 配置现在会转换为模型推理厂商可识别的思考强度，减少带 thinking 请求返回 400 的情况。Opus 4.8 等 Claude 原生思考请求仍保持兼容。

**长时间流式请求更稳定**

* 生产环境网关的最长流式连接时间已从 1 小时放宽到 2 小时。Kimi K3 等长思考、长生成任务更不容易在思考或生成过程中被网关提前切断。

### 07 月 19 日

**新增模型**

* 新增 [qwen3.8-max-preview](https://aihubmix.com/model/qwen3.8-max-preview)：<br />限时福利：Qwen3.8-Max-Preview 调用价格按 1 折计算，相当于用量直接扩大 10 倍，活动限时，先到先用。 <br />Qwen3.8-Max-Preview 是通义千问系列最新一代基座模型，参数量达 2.4T，并仍在持续进化中。相较上一代旗舰 Qwen3.7-Max，它在代码工程（Coding）、专业办公（Cowork）等核心能力上实现显著提升，在全栈开发、数据分析、Office 办公工作流等复杂长程任务中展现出全球领先的综合能力。

### 07 月 17 日

**新增模型**

* 新增 [`kimi-k3`](https://aihubmix.com/model/kimi-k3)：Kimi K3 是 Moonshot AI 发布的开放 3T 级长上下文模型，采用 2.8T 参数、1M 上下文窗口，并原生支持视觉输入，适合长程编码、知识工作、复杂推理和多模态理解场景。调用方式见 [Kimi K3 实测调用指南](/cn/blogs/kimi-k3-guide)（三接口示例与能力支持矩阵）。
* 新增 [`hy-3d-3.1`](https://aihubmix.com/model/hy-3d-3.1)：腾讯混元生 3D 专业版模型，支持文生 3D、图生 3D 与多视图输入，面向游戏、电商展示、3D 打印、产品设计等 3D 资产生成场景；3.1 版本在几何精度与纹理细节上进一步提升，并支持八视图多角度输入。

**3D 生成接口上线**

* 新增 `/v1/3d/generations` 异步 3D 生成接口，首期接入腾讯 TokenHub 混元 3D。支持提交生成任务和查询任务结果，便于把 3D 资产生成接入自动化工作流。

**Kimi K3 动态工具兼容**

* Kimi K3 请求中的 message-level 动态工具声明会被保留并透传，模型推理厂商不再因为工具声明丢失而返回 400；使用 Kimi 动态加载工具的客户端兼容性更好。

**请求转换错误更清晰**

* Chat Completions 中的 custom tool、Cohere 文本块和 `assistant.content: null` 等请求形态兼容性提升。合法请求更稳定地到达模型推理厂商；畸形或不支持的输入会返回结构化错误，不再被误判为空 200 成功。

**Seedream 图片计费口径更新**

* `doubao-seedream-5-0-pro` 的图片生成计费现在支持按输出像素档和输入图片张数计价，文生图、图生图等请求的费用更贴近实际生成规格。

### 07 月 15 日

**Gemini 工具调用兼容性修复**

* 通过 OpenAI 兼容接口调用 Gemini/Vertex 时，工具定义或结构化输出 schema 中包含空字符串枚举值的请求不再因模型推理厂商校验返回 400；工具调用和 JSON Schema 工作流更稳定。

### 07 月 14 日

**新增音频模型**

* 新增 [`gpt-audio-1.5`](https://aihubmix.com/model/gpt-audio-1.5)：OpenAI 首个正式可用（GA）的音频模型，支持音频输入与音频输出，可通过 Chat Completions REST API 调用，适合语音对话、音频理解与音频生成场景。
* 新增 [`gpt-4o-transcribe-diarize`](https://aihubmix.com/model/gpt-4o-transcribe-diarize)：带说话人分离的 ASR 转写模型，可把对话中的音频片段关联到不同说话人；该模型仅在 Transcription API 中可用。

**智能路由功能介绍页上线**

* [智能路由功能介绍页](https://aihubmix.com/llm-router/auto)现已上线，展示公开路由维度评分与在池模型。同时新增两个开放接口：[获取自动路由策略对应模型范围](/cn/api/RouterEndpoints/leaderboard)返回 5 大类 23 个子维度的模型评分、价格系数、首字延迟与在池模型，[获取模型厂商图标](/cn/api/RouterEndpoints/vendors)返回模型厂商的显示名与图标；图像与视频生成维度暂未纳入。使用方式参见[模型智能路由](/cn/api/llm-router)文档。

### 07 月 13 日

**API 错误提示更一致**

* `/v1/responses` 使用未知模型时，现在返回 400 `no_available_channel`，与其他 API 入口保持一致，便于客户端按“无可用服务”场景处理，而不是收到 500。

**请求参数校验更早返回给客户端**

* 请求体转换或参数校验失败时，API 会直接返回相应的 400/错误信息，不再把原始请求继续转给模型推理厂商，减少无效调用和难以理解的失败。

**Claude Code 缓存命中更稳定**

* Claude Code 通过 Bedrock 调用 Claude 时，同一会话内的 prompt cache 命中更稳定，有助于减少重复缓存写入费用和首 token 延迟。

**Gemini 多轮/缓存请求粘性更精确**

* Gemini 请求现在按响应中实际出现的思考签名或缓存活动决定是否保持同一服务，减少多轮验签或缓存状态不一致；图片生成等无状态任务不会被不必要地固定到同一服务。

### 07 月 10 日

**新增模型**

* 新增 `gpt-5.6-sol`、`gpt-5.6-terra`、`gpt-5.6-luna` 三款 GPT-5.6 系列模型（OpenAI 2026-07-09 正式发布）。三档均为 1,050,000 上下文窗口、128K 最大输出、知识截止 2026-02-16，支持文本与图像输入，可通过 Chat Completions、Responses 与 Claude 兼容的 Messages 接口调用。Sol 为旗舰档，面向复杂专业工作，官方称其为当前最佳编码模型；Terra 性能与 GPT-5.5 相当且价格减半；Luna 面向成本敏感场景。

**GPT 提示词缓存文档上线**

* 新增 [GPT 提示词缓存](/cn/api/GPT-Cache)文档：GPT-5.6 系列起缓存写入按 1.25 倍输入价计费、缓存读取按 0.1 倍计费、缓存至少保留 30 分钟；覆盖 `prompt_cache_key` 与显式缓存断点参数说明、计费逻辑、接口示例与命中排查。[提示词缓存实践](/cn/practices/prompt-caching)与 [Claude 提示词缓存](/cn/api/Claude-Cache)的 OpenAI 缓存口径同步更新。

**Claude Fable/Mythos 思考模式兼容**

* Claude Fable 与 Mythos 系列在请求中使用 `reasoning_effort` 时，现在会按 adaptive thinking 处理，减少这类模型因思考参数不匹配导致的模型推理厂商 400。

**Claude 与 Gemini 的 stop 参数生效更一致**

* OpenAI 兼容请求里的 `stop` 现在会映射到 Claude 与 Gemini 原生请求。Claude 不接受的纯空白 stop 会被过滤，OpenAI/Gemini 的数量限制也按各自规则处理，跨协议生成截断更稳定。

**gpt-chat-latest token 上限参数兼容**

* `gpt-chat-latest` 以及后续 GPT/ChatGPT latest 别名在需要时会保留 `max_completion_tokens`，减少因误发旧字段 `max_tokens` 导致的 400。

**Key 额度耗尽提示更清晰**

* 当 Key 级别使用限额耗尽时，API 现在返回更明确的引导文案，提示去调整并激活 Key 限额，而不是仅返回底层 quota 报错。

**Tool calls 响应结构对齐 OpenAI**

* 非流式 chat 响应在只有 `tool_calls`、没有文本内容时，现在会显式返回 `content: null`，提升 OpenAI 风格 SDK 与响应解析器的兼容性。

### 07 月 09 日

**结构化输出修复:JSON 格式错误自动修复**

* 新增 Key 级别的[结构化输出修复](/cn/api/structured-output-repair)能力,默认关闭。开启后,对声明了结构化 JSON 输出的非流式请求,当模型返回的 JSON 存在截断、尾随逗号、代码块包裹等格式错误时,网关在返回前自动修复为可解析的合法 JSON,数值保持原样,客户端无需改动。支持 Chat Completions、Responses、Claude、Gemini 四种协议;发生修复时响应带有 `X-JSON-Repaired: true` 响应头。

**Claude 提示词缓存文档:补齐各模型最小缓存 token 门槛**

* 完善 [Claude 提示词缓存](/cn/api/Claude-Cache) 与[提示词缓存实践](/cn/practices/prompt-caching)文档,补齐按模型区分的最小可缓存 token 门槛(512 / 1,024 / 2,048 / 4,096),新增 Claude Opus 4.8、Opus 4.7、Fable 5 等当前模型。该门槛并非随模型版本升级而提高;低于门槛的前缀即使显式设置 `cache_control` 也不会被缓存。

**用量看板与结算明细口径对齐**

* 用量看板的聚合结果现在更接近日志明细结算口径，减少并发聚合丢数，并统一延迟重放时的小时归桶。历史看板数据仍可能存在小幅差异；对账和结算仍以请求日志明细为准。

**新增模型**

* 新增 `grok-4.5`，面向代码、Agent 任务和知识工作，支持可配置推理、工具调用和 500K 上下文，适合代码修复、复杂工程任务、知识问答与 Agent 工作流。

### 07 月 08 日

**gpt-5.5+ 工具调用自动桥接 Responses**

* 使用 OpenAI 兼容 `/v1/chat/completions` 调用 gpt-5.5 及以上模型时，带 tools 和 `reasoning_effort` 的请求会自动走 Responses 能力，减少模型推理厂商因参数组合不支持导致的 400。现有客户端无需改成 `/v1/responses` 也能获得更稳的工具调用体验。详见：[Responses API](https://docs.aihubmix.com/cn/api/Responses-API)

### 07 月 07 日

**结构化输出跨协议兼容**

* OpenAI 兼容的 `response_format` 与 Claude 原生 `output_config.format` 现在可在相关路径中双向适配。调用方在跨 OpenAI/Claude 协议切换时，更容易保留结构化输出约束。详见：[Structured Output](https://docs.aihubmix.com/en/api/Structured-Output)。

**Vertex AI 的 `/v1/messages` 调用更稳定**

* 通过 Vertex AI 调用 Gemini 等非 Claude 模型时，`/v1/messages` 请求会按模型族正确分流，减少误走 Claude 路径导致的 not found 或 404。

### 07 月 06 日

**Gemini 原生端点补齐**

* `@google/genai` SDK 通过 AIHubMix 的 Gemini 入口调用时，现已支持原生 Embeddings、Interactions 和 Context Caching 相关能力。此前这些路径可能返回路由未注册或 404；现在可用于向量生成、交互式推理（含文本与图像生成）和缓存创建/查询/删除等工作流。详见：[Gemini 原生 SDK 接入](/cn/api/Gemini-SDK)

**长上下文模型计费覆盖扩展**

* `hy3-preview`、ERNIE、Grok、Mimo 等长上下文模型现已支持按上下文长度分档计费，费用计算更精确。

**Vertex AI 流式日志指标修复**

* Vertex AI 的 Gemini/Claude 流式请求现在会记录更准确的首 token 与延迟数据，日志页和监控排查看到的耗时信息更可信；该变化不影响模型响应内容。

**新增模型**

* 新增 `tencent-hy3` 文本生成模型（腾讯混元 Hy3 正式版）。MoE 架构，295B 总参数 / 21B 激活参数，256K 上下文窗口。支持快慢思维融合推理模式，适合复杂推理、代码生成和 Agent 工作流。Apache 2.0 许可证开源。

### 07 月 03 日

**Jina Search/Reader 支持 POST 与文件上传**

* Jina Search 与 Reader 现在支持 POST 调用；Reader 可通过 multipart 上传 PDF、Word、Excel、PPT、HTML 和图片等本地文件。默认响应更贴近 Jina 原生 markdown；需要 JSON 的客户端可显式发送 `Accept: application/json`。

**Responses 端点的 Azure 类服务调用更稳定**

* 修复 `/v1/responses` 经兼容桥接调用 Azure 类非 GPT 服务时可能因 `api-version` 为空而返回 404 的问题，减少此类请求的直接失败。

**流式回答截断问题修复**

* 修复部分 vLLM / Azure Foundry 类模型推理服务在流式输出中可能随机截断的问题，用户更容易收到完整回答、结束信号和用量信息。

**新增模型：Command A Plus 05-2026**

* 新增 `command-a-plus-05-2026` 文本生成模型，适合企业对话、文本生成和 Agent 工作流。

### 07 月 01 日

**Jina 搜索与网页读取接口上线**

* 新增 Jina 搜索与 Reader 能力，支持通过 AIHubMix API Key 调用 Jina 搜索结果获取与网页内容读取能力，适合需要外部网页信息检索、资料读取和 Agent 工具调用的场景。详见：[Jina AI](https://docs.aihubmix.com/cn/api/Jina-AI)

**Veo 3.1 图生视频支持首尾帧与参考图**

* Veo 3.1 图生视频现支持首帧、尾帧和参考图输入，用户可以更精确地控制视频起止画面、角色参考和风格参考，适用于更复杂的视频创作工作流。详见：[视频生成](https://docs.aihubmix.com/cn/api/Video-Gen)

**Gemini 多渠道重试稳定性优化**

* 优化 Gemini 请求在跨渠道重试时的兼容性，减少部分重试场景下的 400 错误，提升多渠道兜底调用的成功率。详见：[Gemini 使用指南](https://docs.aihubmix.com/cn/api/Gemini-Guides)

**OpenAI 兼容响应字段对齐**

* OpenAI 兼容接口在非流式和流式响应中保留 `logprobs`、`refusal`、`finish_reason` 等字段的 `null` 值，减少依赖 OpenAI 标准响应结构的 SDK、Agent 和日志解析工具出现兼容差异。

**Claude Code 接入隐私与兼容性优化**

* 优化 Claude Code 通过 AIHubMix 调用 Claude 模型时的请求兼容处理，减少客户端环境信息进入发往模型推理厂商的请求，提升第三方 Agent 客户端接入的隐私保护。

**登录注册与个人中心能力完善**

* 自建账号体系补齐邮箱验证码登录/注册、密码设置、资料修改、第三方账号绑定解绑与账号注销等后端能力，并加强验证码用途隔离与禁用账号拦截；Stripe 充值回调处理也更稳健。

**新增模型**

* **claude-sonnet-5**（对话 / 推理 / Agent 场景）。
* **gemma-4-31b**、**longcat-2.0**（文本生成模型）。
* **gemini-3.1-flash-lite-image**（图像能力模型）。
* **mai-image-2.5**、**mai-image-2.5-flash**（图像生成模型）。

### 06 月 29 日

**图像生成计费与参数兼容性优化**

* `gpt-image-2` 在 Images 端点的计费口径统一为按 token 结算；GLM 图像生成支持透传 `watermark_enabled`、`quality` 等扩展参数，去水印与质量控制等设置可按模型推理厂商能力生效。详见：[图像生成](https://docs.aihubmix.com/cn/api/Image-Gen)

**Gemini 文件上传日志优化**

* Gemini 文件上传接口失败时不再写入用户可见的普通请求日志，减少非推理接口在日志页产生的噪音；内部排障日志仍会保留。

### 06 月 27 日

**新增 Deep Research 模型**

* 新增 **o4-mini-deep-research** 与 **o3-deep-research**，仅支持通过 `/v1/responses` 接口调用；请求需包含 `web_search_preview` 或 `mcp` tools，适合需要深度资料检索与研究型回答的场景。

### 06 月 25 日

**Responses 协议支持任意模型**

* `/v1/responses` 端点不再限于 GPT 系列，现可调用平台上的任意模型。基于 Responses 协议的工具（如 Codex CLI）因此能通过本地模型目录使用 GLM、Gemini、DeepSeek、Kimi、Qwen 等模型，不再局限于 OpenAI 官方模型。

**Step 3.7 Flash 的 Responses 输出修复**

* 修复 `step-3.7-flash` 通过 `/v1/responses` 调用时可能返回空白内容或空响应的问题，推理内容和最终回答现在可正常返回。

**Codex CLI 新增自定义模型支持**

* [Codex CLI](https://docs.aihubmix.com/cn/api/Codex-CLI) 文档新增「在 Codex 中使用自定义模型」教程：通过本地模型目录（`model_catalog_json`）声明 AIHubMix 上的任意模型（GLM、Gemini、DeepSeek、Kimi、Qwen 等），即可在 Codex 的 `/model` 列表里自由切换，不再局限于 OpenAI 官方模型。文档含一键生成前 30 名模型目录的脚本与常见踩坑说明。详见：[Codex CLI · 在 Codex 中使用自定义模型](https://docs.aihubmix.com/cn/api/Codex-CLI#custom-models)

### 06 月 24 日

**新增备用域名支持**

* 新增备用域名 `https://api.inferera.com`，端点与能力和主域名 `https://aihubmix.com` 完全一致。当主域名访问异常（如无法连接、超时）时，可将请求地址替换为备用域名，API Key、模型、请求体等参数保持不变。

### 06 月 23 日

**新增模型**

* 豆包 **doubao-seed-2-1-pro**、**doubao-seed-2-1-turbo**。
* HappyHorse 视频系列 **happyhorse-1.1-t2v**（文生视频）、**happyhorse-1.1-r2v**（参考生成）、**happyhorse-1.1-i2v**（图生视频）。

**Stripe 结账体验优化**

* Stripe 结账页会自动预填账户邮箱，并减少不必要的姓名和账单地址收集，支付宝等支付方式的充值流程更简洁。

**负余额账户调用限制**

* 当账户余额低于 -\$1 时，将无法继续调用免费模型；请充值后再发起调用。

### 06 月 22 日

**新增 AIHubMix CLI（命令行工具）文档**

* 新增 [AIHubMix CLI（命令行工具）](https://docs.aihubmix.com/cn/api/aihubmix-cli) 文档：单一二进制、零依赖（无需 Python / Node / Go），在终端即可查询账户余额、管理 API Key、查看可用模型，并对脚本与 AI Agent（如 Claude Code）友好。

**新增模型智能路由（LLM Router）**

* 请求模型名填 `auto`，网关按请求内容从平台数百个模型中自动选出最优模型，支持成本优先 / 质量优先 / 低延迟等策略，按实际命中模型计费，客户端代码零改动。详见：[模型智能路由](https://docs.aihubmix.com/cn/api/llm-router)

**DeepSeek 缓存命中率修复**

* 修复 `deepseek-v4-pro`、`deepseek-v4-flash` 两个模型缓存命中率低于预期的问题。

**新增 AIHubMix Skill（AI 编程助手扩展）**

* 为 Codex、Claude Code、Cursor、Cline 等支持 Skills 的 AI Agent 提供本地扩展能力：用自然语言完成 AIHubMix 接入、模型查询、按能力选型、示例生成与错误排查。该 Skill 按需从官方接口读取模型、价格、协议契约等实时信息，避免 Agent 依赖过期记忆。详见：[Skills](https://docs.aihubmix.com/cn/skills)

### 06 月 17 日

**新增可灵（Kling）视频模型**

* 接入可灵视频生成全能力：文生视频、图生视频、多图参考与 omni 多模态生成，按模型名走原生协议调用。

### 06 月 16 日

**OpenClaw 接入插件问题已修复**

* AIHubMix 的 OpenClaw 接入插件 [aihubmix-auth](https://github.com/akakenle/aihubmix-auth) 已修复此前的接入问题，现可稳定使用。安装并填入一把 AIHubMix Key 即可在 OpenClaw 中同时调用 OpenAI / Anthropic / Gemini 等模型。

**新增模型**

* 智谱 **glm-5.2**。

### 06 月 15 日

**新增 Open Design 接入支持**

* AIHubMix 现已是 [Open Design](https://open-design.ai/)（开源、本地优先的 Claude Design 平替）内置支持的 BYOK 网关。在其 API（BYOK）模式里选 AIHubMix、填一把 Key，即可同时驱动聊天 / 图像 / 视频 / 语音生成，并按模型名走各家原生协议。详见：[Open Design 接入教程](https://docs.aihubmix.com/cn/clients/Open-Design)

**智谱 GLM 5.2 支持推理强度分档**

* 原生智谱渠道的 `glm-5.2` 支持 `reasoning_effort` 分档调节思考深度，旧版模型按版本自动分流，调用方无需改动。

**新增模型**

* **kimi-k2.7-code-highspeed**（Kimi 代码高速版）。

### 06 月 13 日

**新增模型**

* **coding-glm-5.2** 及免费版 **coding-glm-5.2-free**。

### 06 月 12 日

**模型映射与错误回退**

* **新增模型映射（Mapping）与错误回退（Fallback）：** 在控制台为每个 API Key 配置模型名映射与错误时回退，把客户端的模型别名改写为真实模型名，主模型失败时自动切换到备用模型，按最终响应模型计费，客户端代码零改动。详见：[模型映射与回退](https://docs.aihubmix.com/cn/api/Model-Mapping-Fallback)

**新增模型**

* **kimi-k2.7-code**。

### 06 月 11 日

**step-3.7-flash 限时 1 折**

* step-3.7-flash 限时 1 折优惠：输入每百万 token 仅 0.022 美元，输出每百万 token 仅 0.132 美元，欢迎体验。

**模型下架与自动路由**

* `claude-opus-4-20250514`、`claude-sonnet-4-20250514` 官方将于 6 月 15 日下架，届时平台会自动将下架模型路由至同系列 4-5 版本。

### 06 月 10 日

**新增模型**

* **claude-fable-5**【已退役】。

**Claude 新模型 Fable 5 / Mythos 5 的特性说明**

* **Fable 5 有更强的安全护栏，部分正常问题也可能被拦：** 会对网络安全、生物 / 化学、模型蒸馏 / 推理提取等方向做额外分类。有些技术研究、漏洞分析、生物医药相关问题，可能被拒绝，或转交到 Opus 4.8 回答。
* **Mythos 5 是受限访问，不是普通开放模型：** Mythos 5 和 Fable 5 能力同源，但少了部分安全分类器；目前只面向 Project Glasswing / 获批客户。一般用户实际用到的是带护栏的 Fable 5。
* **API 成本更高：** Fable 5 价格为每百万输入 token 10 美元、每百万输出 token 50 美元，约为 Opus 4.8 的两倍。
* **隐私：** Fable 5 / Mythos 5 被列为 Covered Models，默认要求至少 30 天数据保留，不支持 Zero Data Retention。
* **API 调用拒绝显示：** Fable 5 拒绝请求时，API 返回的是 HTTP 200，但 `stop_reason` 是 `refusal`。

### 06 月 08 日

**Gemini 兼容接口支持音频输入**

* OpenAI 兼容接口（`/v1/chat/completions`）调用 Gemini 时支持 `input_audio` 音频输入（此前会被静默丢弃），并在返回的 usage 中补齐 audio\_tokens 计量。

### 06 月 05 日

**新增模型**

* **grok-build-0.1**、**hy3-preview**、免费模型 **step-3.7-flash-free**。

### 06 月 04 日

**新增模型**

* 通义千问 **qwen3.7-plus**。

### 06 月 01 日

**新增模型**

* MiniMax **minimax-m3**。
* 百度 **musesteamer-air-image**（图像生成）。

### 04 月 16 日

**新增模型支持**

* **Claude 4.7 系列：** 正式接入最新一代 Claude 4.7 模型，包括 `claude-opus-4-7` 以及具备深度思考能力的 `claude-opus-4-7-think`。该系列在复杂逻辑推理、代码编写及长文本处理能力上实现大幅跃升。详见官方文档：[Claude 4.7 新增参数说明](https://docs.aihubmix.com/cn/blogs/claude-opus4.7)

### 04 月 08 日

**模型库扩容**

* **智谱 AI 更新：** 新增 `glm-5.1` 模型支持，针对中文语境下的语义理解、创意生成及多轮对话逻辑进行了深度优化。

### 04 月 04 日

**多模态视频模型上线**

* **Wan 2.7 全系列集成：** 深度接入 Wan 2.7 视频生成大模型，提供全场景创作支持：
  * `wan2.7-t2v`：高品质文生视频。
  * `wan2.7-i2v`：精准图生视频。
  * `wan2.7-r2v`：基于参考视频的风格迁移与生成。
  * `wan2.7-videoedit`：智能视频编辑与重绘。

### 04 月 02 日

**大规模模型接入**

* **多模态与通用模型：** 新增智谱 `glm-5v-turbo`（多模态理解）及阿里通义千问 `qwen3.6-plus`。
* **高性能视频模型：** 接入字节跳动豆包系列 `doubao-seedance-2-0-fast-260128` 等模型，显著提升视频生成响应速度。

### 03 月 29 日

**日志明细页面**

* 首 Token 延时：帮助判断请求启动速度（从发起请求到返回第一个 Token 的耗时）
* 吞吐量：用于直观衡量模型输出速度
* E2E：从发送请求到响应结束的整体耗时，用于评估完整请求性能
* 服务商：标识请求实际调用的模型供应商
* 状态：标识请求执行结果（如成功 / 失败），用于快速判断请求是否异常
* tid：唯一请求标识，在遇到问题时可提供给技术支持进行快速排查

### 03 月 23 日

* AIHubMix 全球加速网络正式上线：自建全球边缘节点与智能调度体系，通过持续监控与动态优化，实现响应延迟降低 75%、稳定性提升 60%、可用性达 99.99%，让 AI 应用体验更快更稳。
* 新增 7×24 实时健康监测：多区域探针每分钟全网检测延迟、成功率与稳定性，异常可在用户感知前自动识别并处理，保障服务持续稳定。
* 优化智能流量调度：基于多时间窗口动态计算节点健康评分，毫秒级自动切换最优路径，显著降低波动与超时，提升整体请求成功率。

### 02 月 08 日

* 新功能： Chat → Responses 兼容调用 本次上线 Chat → Responses 兼容能力，支持通过 chat/completions 接口调用 OpenAI 仅支持 Responses 协议的模型，包括 gpt-5.2-codex、gpt-5.1-codex-max、gpt-5.2-pro 等。 如需要强制 AIHubmix 的 chat 接口让背后路由都走 Responses 协议，请在请求中添加 Header：X-Use-Responses-Enabled: true。当模型同时支持 Chat 与 Responses 双协议时，设置该参数将强制请求使用 Responses 接口。当前 Responses 协议暂不支持音频输入输出，请注意使用场景。
* 模型弃用通知：OpenAI 将于 2026 年 2 月 17 日 下线 chatgpt-4o-latest，我们会在下线后自动将 chatgpt-4o-latest 映射至 gpt-4o-2024-11-20

## 2025 年

### 12 月 15 日

* 新功能： Google 接口已支持 [Files API](https://docs.aihubmix.com/cn/api/Gemini-Guides#files-api)

### 9 月 22 日

* 新增 [Qwen系列、豆包seedream4以及百度系列画图模型](/cn/api/Image-Gen)

### 8 月 10 日

* 推出 [Aihubmix 图片生成 MCP](/cn/clients/AHM-mcp)，方便开发者接入图片生成服务

### 8 月 1 日

* 在 Claude Code 中[使用 AiHubMix 平台的任何大模型](/cn/api/CC-any)

### 7 月 29 日

* 新增 [AI SDK](/cn/api/AISDK) 支持，一个 KEY 接入海量模型。

### 7 月 26 日

* 新增 [Flux 接口](/cn/api/Image-Gen) 支持，高质量图片秒出。

### 7 月 23 日

* 新增 [Qwen Code](/cn/api/Qwen-code) 支持，利用 Aihubmix 平台的所有大语言模型来提供支持。

### 7 月 4 日

* 新增 [llms.txt](/en/llms) 支持，一键获取标准化模型导航，让你的 LLM 助手快速读懂全平台模型生态。

### 6 月 29 日

* 新增 [Gemini Cli](/cn/api/Gemini-Cli) 转发支持，多种使用方式，由你灵活掌控。
* OpenAI Responses API 接口新增代码解析器和 Remote MCP 调用。

### 6 月 26 日

* 新增 [通用图形接口](/cn/api/Image-Gen)，支持多种主流模型，包括 OpenAI、Ideogram、Stability、Google Imagen。

### 6 月 23 日

* 推出 [应用标识码 APP-Code](/cn/api/App-code)，为开发者们提供全部模型 10% 优惠；

### 6 月 18 日

* 新增 [HTTP 状态码](/cn/FAQs/HTTP-Codes) 文档，帮助用户更好地理解错误信息。

### 6 月 13 日

* 新增 Veo3.0 视频生成支持，丰富创作形式。

### 6 月 9 日

* 支持 openai 的推理总结 (Reasoning summaries) 显示,适用于 responses api。

### 6 月 5 日

* 新增 Gemini 隐式缓存功能，支持自动命中与命中反馈。开发者可以通过 usage\_metadata 判断命中情况。成本节省非保证，实际效果因请求结构和使用场景而异。

### 5 月 31 日

Claude 4 新功能全面支持

* ⏳ **新的缓存周期**：1 小时级别的缓存<sup>Beta</sup> 支持
* 🎉 **新的文本编辑工具**：Claude 4 模型支持全新的 text\_editor\_20250429 工具类型和 str\_replace\_based\_edit\_tool 工具名称
* 🚫 **拒绝停止原因**：引入新的 refusal 停止原因，用于处理模型因安全原因拒绝生成的内容
* 🧠 **扩展思考**：Claude 4 模型返回完整思考过程的摘要，提供扩展思考的全部智能优势
* 🔄 **交错思考**：支持工具使用与扩展思考交错，实现更自然的对话体验（Beta）
* ⚠️ **不再支持的功能**：
  * Claude 4 文本编辑工具不再支持 undo\_edit 命令
  * 移除了 token-efficient-tools-2025-02-19 支持（仅 Claude 3.7 可用）
  * 移除了 output-128k-2025-02-19 支持（仅 Claude 3.7 可用）
* 📚 更新了完整的迁移指南和代码示例，帮助用户从 Claude 3.7 平滑迁移到 Claude 4

### 5 月 22 日

* 新增对 Dify 插件的支持，实现 Aihubmix 模型在 Dify 中的无缝集成。只需一个密钥，扩展并管理两百多个模型。

### 5 月 17 日

* 支持为编程任务而生的 codex-mini-latest，可通过 Responses api 端点或 Codex CLI 调用。
* 支持谷歌 imagen 3.0 绘图和 veo 2.0 视频生成，丰富你的创作形式。
* gemini-2.0-flash-exp 升级为正式预览版 gemini-2.0-flash-preview-image-generation

### 5 月 9 日

新增 [Ideogram AI V3](/cn/api/IdeogramAI) 接口，Ideogram 最先进的图像生成模型。

### 5 月 6 日

新增 [实用管理脚本](/cn/api/Cli)，支持命令行管理密钥、查看账户和可用模型列表等。

### 4 月 26 日

1. 万众期待的 OpenAI 绘图接口 \gpt-image-1\ 正式上线，支持文生图、图生图。
2. 支持 Gemini 原生调用，可以精准控制 Flash 2.5 的推理预算。

### 4 月 24 日

集成了 Jina AI 的三个核心接口，助你轻松构建功能强大的智能体。三个接口分别是：向量嵌入 (Embeddings)、重排序 (Rerank)和深度搜索 (DeepSearch)

### 4 月 20 日

OpenAI Responses api 端点支持，工具支持更全面。

### 4 月 17 日

新增 OpenAI [CodeX CLI 支持](/cn/api/Codex-CLI)！在命令行中用自然语言编程。

### 4 月 12 日

通过在模型 id 后方追加 :surfing，[<sup>让任何模型具备搜索能力 Beta</sup>](/cn/api/LLM-Search)

### 4 月 9 日

支持 Claude prompt caching，高频提示词重复使用可节省高达 76% 成本！

### 4 月 7 日

支持 Ideogram AI 绘图接口，文字绘制能力强劲，支持生图、混合、局部编辑和放大等。

### 4 月 5 日

全新文档，带给大家更好的体验

### 3 月 30 日

支持 Claude 文本编辑工具 (Claude Text Edit Tool)

### 3 月 24 日

启用全新的三叉戟 Logo

### 3 月 16 日

新增了对 OpenAi 和 Google Gemini 模型的原生搜索功能的支持；未来将完善这个接口扩展支持第三方搜；

### 3 月 15 日

新增模型：gpt-4o-mini-search-preview 和 gpt-4o-search-preview

### 3 月 07 日

o1 和 o3-mini 价格下降 10%，跟官网一致；

### 3 月 06 日

aihubmix-DeepSeek-R1 由于微软价格上涨 7 倍因此该模型价格上涨 7 倍，推荐使用火山的 DeepSeek-R1，稳定又便宜；新增 qwen-qwq-32b 和 qwen2.5-vl-72b-instruct

### 2 月 28 日

Claude 模型全面降价 15%；新增模型 gpt-4.5-preview；注意价格极其昂贵，调用请注意；

### 2 月 26 日

提升 Deepseek 稳定性；来自字节的最稳定，推荐用这两个：DeepSeek-R1 和 DeepSeek-V3；

### 2 月 25 日

增模型 claude-3-7-sonnet-20250219

### 2 月 24 日

* gpt-4o 概率性出现返回很慢的情况，次为厂商问题；建议暂时改用 gpt-4o-2024-11-20
* Perplexity api 暂时下线，Perplexity 官方的计费模式较为复杂，成本高于本平台的定价结构，我们调整价格后重新上线；
* 字节官方限时折扣结束恢复原价，DeepSeek-R1 价格已上调
* 新增模型详情页及参数信息

### 2 月 23 日

* 字节官方限时折扣结束恢复原价，DeepSeek-V3 价格已上调；预计字节的 R1 近期也会恢复原价，所以我们也会同步涨价

### 2 月 18 日

* 新增模型：kimi-latest（官方计费根据输入内容长度 8k,32k,128k 分 3 档计费，本站不支持该计费结构，取中 32k 档为计费标准，价格敏感介意勿用）
* 优化了网站页面结构；
* 日志页面并入用量统计页；
* 公告内容移到模型广场页，
* 设置移到头像下面；
* aihubmix-DeepSeek-R1 价格下降 50%
* 新增模型：gemini-2.0-pro-exp-02-05-search，gemini-2.0-flash-exp-search，集成了谷歌官方搜索联网功能
* 新增模型：gemini-2.0-flash、gemini-2.0-pro-exp-02-05、gemini-2.0-flash-lite-preview-02-05 新增模型：o3-mini，o1（注这两个模型后台扣费比官方贵 10% 左右，因为这两个模型帐号帐号有限）

### 2 月 4 日

* o1 模型 openai 官方不支持传入参数 stream
* o3-mini 不支持传入参数 temperature，o3-mini 新增参数 Reasoning effort；可以传入"low, medium, high" 如果不传默认为 medium

### 2 月 1 日

功能：新增 openai 声音模型输入输出的功能支持，api.aihubmix.com 服务器可用，主站服务器稳定 1 周后更新支持。总体后台扣费和官方一致，暂时日志只展示文字部分 token 声音费用暂时无法展示，但不影响使用

新增模型：

* o3-mini，o1；（注这两个模型后台扣费比官方贵 10% 左右，因为这两个模型帐号帐号有限）
* aihubmix-DeepSeek-R1（推荐，比较稳定）
* qwen-max-0125（即 Qwen2.5-Max）、sonar-reasoning
* deepseek-ai/DeepSeek-R1-Zero和deepseek-ai/DeepSeek-R1，deepseek-r1-distill-llama-70b
* aihub-Phi-4
* Doubao-1.5-pro-256k、Doubao-1.5-pro-32k、Doubao-1.5-lite-32k、Doubao-1.5-vision-pro-32k
* sonar、sonar-pro（perplexity ai 最新发布）
* gemini-2.0-flash-thinking-exp-01-21
* deepseek-reasoner（即 DeepSeek-R1）
* MiniMax-Text-01
* codestral-latest（Mistral 推出了新的 code 模型 - Codestral 25.01）

### 1 月 23 日

新增模型：

* aihub-Phi-4
* Doubao-1.5-pro-256k、Doubao-1.5-pro-32k、Doubao-1.5-lite-32k、Doubao-1.5-vision-pro-32k
* sonar、sonar-pro（perplexity ai 最新发布）
* gemini-2.0-flash-thinking-exp-01-21
* deepseek-reasoner（即 DeepSeek-R1）

### 1 月 19 日

* 新增 Perplexity Ai API 模型；仅支持 api.aihubmix.com 预览版服务器调用，如果没问题我们会更新到主服务器 aihubmi.com； api.aihubmix.com 为预览版服务器，后续新功能先更新到这个服务器，通常稳定 1 周我们再更新到主服务器 aihubmix.com 新增模型：
* MiniMax-Text-01
* codestral-latest（Mistral 推出了新的 code 模型 - Codestral 25.01）

### 1 月 6 日

* 新增 gemini-2.0-flash-exp-search，支持谷歌原生联网搜索功能；官方 gemini 2.0 flash 模型的联网需要额外传入参数才支持联网功能，aihubmix 做了集成，模型名字加上 search 参数即可使用
* 新增模型 deepseek-ai/DeepSeek-V3

### 1 月 1 日

* 新增模型广场页面代替原来的模型/价格页面

## 2024 年

### 12 月 30 日

* 修复 gemini-2.0-flash-thinking-exp-1219 模型只输出思考没有答案问题
* 修复余额提醒邮件收不到问题

### 12 月 22 日

* 新增用量统计页面，新增充值记录页面
* 新增豆包系列模型：Doubao-lite-128k、Doubao-lite-32k、Doubao-lite-4k、Doubao-pro-128k、Doubao-pro-256k、Doubao-pro-32k、Doubao-pro-4k
* 新增模型：gemini-2.0-flash-thinking-exp-1219
* 新增模型：gemini-2.0-flash-exp、aihubmix-Mistral-Large-2411、aihubmix-Llama-3-3-70B-Instruct、grok-2-1212、grok-2-vision-1212
* 新增模型：gemini-exp-1206、llama-3.3-70b-versatile、learnlm-1.5-pro-experimental

### 12 月 14 日

* 新增模型：gemini-2.0-flash-exp、aihubmix-Mistral-Large-2411、aihubmix-Llama-3-3-70B-Instruct

### 12 月 8 日

* 新增模型：gemini-exp-1206、llama-3.3-70b-versatile、learnlm-1.5-pro-experimental
* 新增用量统计页面

### 11 月 21 日

* 近期新增模型：gpt-4o-2024-11-20，step-2-16k，grok-vision-beta，
* 千问 2.5turbo 百万上下文模型：qwen-turbo-2024-11-01

### 11 月 07 日

* 兼容 Claude 原生 sdk，v1/messages 接口已支持上线；
* Claude 原生接口的缓存和控制计算机功能还不支持（prompt caching 和 computer use）我们会在接下来的两周内继续完善。

### 11 月 05 日

* 新增模型：claude-3-5-haiku-20241022
* 新增马斯克 x.ai 最新模型 grok-beta

### 10 月 23 日

* 新增模型：claude-3-5-sonnet-20241022

### 10 月 10 日

OpenAI 最新的缓存功能现已上线。此功能目前支持以下模型：

* GPT-4o
* GPT-4o-mini
* o1-preview
* o1-mini 请注意，gpt-4o-2024-05-13 版本不在官方支持范围内。 如果请求命中缓存，您将能够在后台日志中看到相关的缓存 token 数据。 更多详细信息和使用规则，请访问 OpenAI 官方网站：OpenAI 缓存功能详情

### 10 月 03 日

* gpt-4o 模型后台计费下降价格同步官方
* 新增模型：aihubmix-Llama-3-2-90B-Vision，aihubmix-Llama-3-70B-Instruct
* 新增 Cohere 最新模型 aihubmix-command-r-08-2024，aihubmix-command-r-plus-08-2024

### 9 月 19 日

* 新增模型：whisper-large-v3 和 distil-whisper-large-v3-en
* 注意：Whisper 模型实际计费是按照输入的秒数计费的，但是目前页面价格展示有问题未来会修复，后台底层计费没有问题 whisper-1 完全同步 Openai 官方扣费

### 9 月 13 日

* 新增模型 o1-mini 和 o1-preview；<br />注：最新这两个模型，要求传入参数有变，一些壳软件如果不更新默认传入的参数会报错;

需要注意

经测试，o1 模型不支持以下内容，并报错：

* system 字段：400 报错
* tools 字段：400 报错
* 图片输入：400 报错
* json\_object 输出：500 报错
* structured 输出：400 报错
* logprobs 输出：403 报错
* stream 输出：400 报错
* o1 系列：20 RPM，150,000,000 TPM，很低，随时 429 报错
* 其他：temperature, top\_p and n 被固定为 1；presence\_penalty 和 frequency\_penalty 被固定为 0

### 9 月 10 日

* 新增模型：mattshumer/Reflection-Llama-3.1-70B；ps：据说 llama3.1-70b 最强微调版本
* claude-3 模型价格上调调整，为了维持 Claude 模型稳定供应，目前调用我们会比直接调用官方贵 10%，后续会逐步下调；
* 增加了 Openai 系列模型的并发能力，理论上基本支持无限并发；

### 8 月 11 日

* 新增模型：Phi3medium128k、ahm-Phi-3-medium-4k、ahm-Phi-3-small-128k
* 增加了 Llama 相关模型的稳定性
* 进一步优化了 Claude 模型的兼容性

### 8 月 7 日

* 新增 Openai 刚刚更新 4o 版本 gpt-4o-2024-08-06，见 [https://platform.openai.com/docs/guides/structured-outputs](https://platform.openai.com/docs/guides/structured-outputs)
* 新增 Google 最新模型：gemini-1.5-pro-exp-0801

### 8 月 4 日

* 增加了在线直接支付充值
* 修复了 Claude 多轮对话格式报错问题：1、messages: roles must alternate between "user" and "assistant", but found multiple "user" roles in a row；
* 优化了 Claude 模型的使用 function 功能时 index 问题
* [https://orisound.cn](https://orisound.cn) 备用服务器将在 9 月 7 日全面下线；目前在使用这个地址的请抽空改成主服务器 [https://aihubmix.com](https://aihubmix.com) 或者备用服务器 [https://api.aihubmix.com](https://api.aihubmix.com)

### 7 月 27 日

* 新增支持 Mistral Large 2，模型名称：Mistral-large-2407 或者 aihubmix-Mistral-large-2407；
* 系统优化

### 7 月 24 日

* 新增最新 llama-3.1 模型 llama-3.1-405b-instruct,llama-3.1-70b-versatile 和 llama-3.1-8b-instant，欢迎尝试；

### 7 月 20 日

* 已修复 gpt-4o-mini 模型在价格计算方面的问题。具体情况如下：<br />文本输入价格：OpenAI 官方的 gpt-4o-mini 模型输入文本的价格仅为 gpt-4o 模型价格的 1/33。<br />图片输入价格：OpenAI 官方的 gpt-4o-mini 模型输入图片的价格与 gpt-4o 模型价格相等。
* 为了确保价格计算的准确性，我们在计算 gpt-4o-mini 模型输入图片的 token 数时，将其乘以 33 倍，以与官方价格对齐。
* 详情可见 Open AI 官方价格 <img src="https://mintcdn.com/aihubmix/UgvkHPDoK6o04763/public/cn/4ominijiage.png?fit=max&auto=format&n=UgvkHPDoK6o04763&q=85&s=8c6ce90f494e1bb56df1aa80d4af4e65" alt="图片" width="939" height="794" data-path="public/cn/4ominijiage.png" /> <img src="https://mintcdn.com/aihubmix/UgvkHPDoK6o04763/public/cn/4ojiage.png?fit=max&auto=format&n=UgvkHPDoK6o04763&q=85&s=0990a3b16ef0da05385df61738f745b3" alt="图片" width="980" height="782" data-path="public/cn/4ojiage.png" />

### 7 月 19 日

* 新增支持 gpt-4o-mini 模型，后台计费同步官方

### 7 月 15 日

* 支持官方的 api 参数 include\_usage，传入参数可返回 stream 模式下的 usage，详情见 官方文档

### 7 月 14 日

* 新版本 nextweb 增加了支持调用非 Openai 模型 调用本站非 OpenAI 模型
* 增加了阿里千问模型的后台扣费，总统调用我们的成本比调用阿里云官方贵 10% 左右
* 优化 azure openai 返回的输出更好的兼容了 Openai 接口
* 支持 Claude-3 的 tool Calling
* 增加了很多新模型，见设置/可用模型

### 7 月 3 日

* 整体后台界面进行了优化
* 日志每条请求记录增加了展示请求时当时的模型单价
* 增加了模型及价格页面 模型/价格

### 6 月 20 日

* 最新 claude-3-5-sonnet-20240620 已支持，调用方法见 调用本站非 open AI 模型教程

### 6 月 18 日

* 后台日志页面现在开始，支持下载使用请求记录

### 6 月 16 日

* 降低了随机到 azure openai 的概率，现在几乎很小概率会随机到

### 6 月 13 日

* 下调 Claude-3 相关模型的费用（Claude 3 Haiku、Claude 3 Sonnet、Claude 3 Opus）后台扣费和官方一致；因此当前我们网站额度零售价格，使用我们的 API 的成本相当于官网 86 折；

### 6 月 10 日

* 优化 gpt-4o 的 token 计费，tokenizer 的 cI100k\_base 改为 0200k\_base，之前的 gpt-4 系列用的是 cI100k\_base；结果就是中文、韩文、日文的流式请求的 token 计数会比之前下降；

### 6 月 8 日

* 新增阿里最新开源模型 Qinwen2
* alibaba/Qwen2-7B-Instruct、alibaba/Qwen2-57B-A14B-Instruct、alibaba/Qwen2-72B-Instruct

### 5 月 20 日

* 新增模型 gemini-1.5-flash
* 新增模型 gpt-4o
* 新增 llama3（llama3-70b-8192、llama3-8b-8192）gemini-1.5-pro、command-r、command-r-plus、欢迎调用尝试
* Claude-3 模型恢复供应；目前本站正在连接 Claude-3 部署在 aws 和 Google cloud 上的端点。
* 为了维持服务器费用及团队成本，Claude-3 模型和价格后台扣费比官方贵 10%
* 后续调用量增加的话，会逐步下调至 5% 左右，甚至更低，
* 目前并发有待测试和随着调用增加而去申请更高的并发调用。

***

更新时间：2026-06-22
