音频理解
POST/v1beta/models/gemini-2.5-pro:generateContent 音频理解
Vortap 支持通过 Gemini 兼容接口提交音频内容,并让模型对音频进行理解、摘要、问答或信息抽取。
接口地址
POST https://www.vortapapi.com/v1/v1beta/models/gemini-2.5-pro:generateContent
该接口保持与 Gemini
generateContent请求结构兼容。
鉴权方式
请在请求中携带 Vortap API Key。示例:
x-goog-api-key: sk-***
也可以通过查询参数传入:
?key=sk-***
查询参数
| 名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
key | string | 是 | Vortap API Key,用于接口鉴权。 |
请求头
| 名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
Content-Type | string | 是 | 请求体格式,通常为 application/json。 |
x-goog-api-key | string | 否 | Vortap API Key。若已通过 key 查询参数传入,可不填写。 |
请求示例
curl "https://www.vortapapi.com/v1/v1beta/models/gemini-2.5-pro:generateContent?key=sk-***" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"contents": [
{
"parts": [
{
"text": "请总结这段音频的主要内容。"
},
{
"inline_data": {
"mime_type": "audio/mpeg",
"data": "BASE64_ENCODED_AUDIO"
}
}
]
}
]
}'
请求体
| 字段 | 类型 | 必填 | 说明 |
|---|---|---|---|
contents | array | 是 | 对话内容列表,包含文本、音频等输入片段。 |
contents[].parts | array | 是 | 单条内容中的多模态输入片段。 |
contents[].parts[].text | string | 否 | 文本提示词,用于说明希望模型完成的任务。 |
contents[].parts[].inline_data | object | 否 | 以内联 Base64 形式提交的音频数据。 |
contents[].parts[].inline_data.mime_type | string | 是 | 音频 MIME 类型,例如 audio/mpeg、audio/wav。 |
contents[].parts[].inline_data.data | string | 是 | Base64 编码后的音频内容。 |
响应示例
{
"candidates": [
{
"content": {
"parts": [
{
"text": "这段音频主要讨论了……"
}
],
"role": "model"
}
}
]
}
使用说明
- 音频文件需要先转换为 Base64 后放入
inline_data.data。 mime_type应与实际音频格式一致,否则可能导致解析失败。- 可在同一个
parts数组中同时提供文本指令和音频内容。 - 如需更稳定的结果,建议在
text中明确说明输出格式、语言和任务目标。