创建模型响应(控制思考长度)
POST/v1/responses 创建模型响应(控制思考长度)
通过 Responses API 创建一次模型响应。某些推理模型只支持 Responses 格式,例如 o3-pro、codex-mini-latest。
POST https://www.vortapapi.com/v1/responses
请求头
| 名称 | 必填 | 说明 |
|---|---|---|
Content-Type | 是 | 固定为 application/json |
Accept | 是 | 建议设置为 application/json |
Authorization | 否 | API Key 鉴权,格式为 Bearer sk-*** |
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
model | string | 是 | 要调用的模型名称,例如 o3-pro |
input | string 或 array | 是 | 用户输入内容。可以传入纯文本,也可以传入消息数组 |
reasoning | object | 否 | 推理相关配置,用于控制模型思考强度 |
reasoning.effort | string | 否 | 控制推理投入程度。常用值包括 low、medium、high |
max_output_tokens | integer | 否 | 限制模型最多生成的输出 token 数 |
reasoning.effort 说明
reasoning.effort 用于影响推理模型在回答前投入的“思考”强度:
| 值 | 说明 |
|---|---|
low | 更快返回,适合简单问题或对延迟敏感的场景 |
medium | 默认的均衡模式,兼顾质量与速度 |
high | 增加推理深度,适合复杂分析、代码、数学或多步骤任务 |
请求示例
curl https://www.vortapapi.com/v1/responses \
-H "Content-Type: application/json" \
-H "Accept: application/json" \
-H "Authorization: Bearer sk-***" \
-d '{
"model": "o3-pro",
"input": "请用三点总结一下什么是量子计算。",
"reasoning": {
"effort": "medium"
},
"max_output_tokens": 800
}'
使用消息数组作为输入
{
"model": "o3-pro",
"input": [
{
"role": "user",
"content": "请解释一下递归,并给出一个 JavaScript 示例。"
}
],
"reasoning": {
"effort": "high"
}
}
响应示例
{
"id": "resp_123",
"object": "response",
"created_at": 1677652288,
"status": "completed",
"model": "o3-pro",
"output": [
{
"id": "msg_123",
"type": "message",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "量子计算是一种利用量子力学原理进行信息处理的计算方式。它使用量子比特,可以表示叠加状态;通过量子纠缠和干涉等现象,在特定问题上可能比传统计算更高效;常见应用方向包括密码学、材料模拟、优化问题和药物研发。"
}
]
}
],
"usage": {
"input_tokens": 18,
"output_tokens": 72,
"total_tokens": 90
}
}
提取文本输出
Responses API 的文本内容通常位于:
output[0].content[0].text
如果响应中包含多个输出项或多段内容,请遍历 output 数组,并读取其中 type 为 output_text 的文本片段。