图片理解
POST/v1beta/models/gemini-2.5-pro:generateContent 图片理解
通过 Vortap 的 generateContent 接口,你可以向视觉模型提交图片与文本提示词,让模型识别、描述或分析图片内容。
接口信息
POST /v1beta/models/gemini-2.5-pro:generateContent
基础地址:
https://www.vortapapi.com/v1
请求地址
https://www.vortapapi.com/v1/v1beta/models/gemini-2.5-pro:generateContent
查询参数
| 名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
key | string | 是 | Vortap API Key,例如 sk-***。 |
请求头
| 名称 | 必填 | 说明 |
|---|---|---|
Content-Type | 是 | 固定为 application/json。 |
请求体
请求体使用 JSON 格式。图片可以通过 inline_data 以内联 Base64 的方式提交,也可以配合文本提示词一起发送。
字段说明
| 字段 | 类型 | 必填 | 说明 |
|---|---|---|---|
contents | array | 是 | 对话内容列表。 |
contents[].parts | array | 是 | 单条内容中的多模态片段,可包含文本和图片。 |
contents[].parts[].text | string | 否 | 文本提示词。 |
contents[].parts[].inline_data | object | 否 | 内联图片数据。 |
contents[].parts[].inline_data.mime_type | string | 是 | 图片 MIME 类型,例如 image/jpeg、image/png。 |
contents[].parts[].inline_data.data | string | 是 | Base64 编码后的图片内容。 |
示例:使用 Base64 图片进行理解
curl "https://www.vortapapi.com/v1/v1beta/models/gemini-2.5-pro:generateContent?key=sk-***" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "请描述这张图片中的主要内容。"
},
{
"inline_data": {
"mime_type": "image/jpeg",
"data": "BASE64_IMAGE_DATA"
}
}
]
}
]
}'
示例响应
{
"candidates": [
{
"content": {
"parts": [
{
"text": "这张图片展示了一只猫坐在窗边,背景中可以看到室内家具和自然光。"
}
],
"role": "model"
},
"finishReason": "STOP",
"index": 0
}
]
}
常见用途
- 识别图片中的物体、人物、场景或文字
- 生成图片描述或标题
- 分析图表、截图、商品图
- 根据图片回答问题
- 对图片内容进行分类或总结
注意事项
data字段需要传入纯 Base64 字符串,不要包含data:image/jpeg;base64,这类前缀。mime_type应与实际图片格式一致。- 如果图片较大,建议先压缩或调整尺寸后再提交。
- 查询参数
key必须携带有效的 Vortap API Key。