视频理解
POST/v1beta/models/gemini-2.5-pro:generateContent 视频理解
使用 Vortap 的 Gemini 兼容接口,可以向模型提交视频、图片、文本等多模态内容,并让模型围绕视频内容进行分析、总结、问答或提取结构化信息。
接口地址
POST https://www.vortapapi.com/v1beta/models/gemini-2.5-pro:generateContent
查询参数
| 名称 | 类型 | 必填 | 说明 |
|---|---|---|---|
key | string | 是 | Vortap API Key,例如 sk-***。 |
请求头
| 名称 | 必填 | 说明 |
|---|---|---|
Content-Type | 是 | 固定为 application/json。 |
请求体
请求体使用 JSON 格式,通过 contents 字段传入对话内容。视频可以通过文件 URI、内联数据或已上传文件引用的方式提供,具体取决于你的接入方式。
示例:基于视频提问
{
"contents": [
{
"parts": [
{
"text": "请总结这个视频的主要内容,并列出关键事件。"
},
{
"file_data": {
"mime_type": "video/mp4",
"file_uri": "https://example.com/video.mp4"
}
}
]
}
]
}
请求示例
curl -X POST "https://www.vortapapi.com/v1beta/models/gemini-2.5-pro:generateContent?key=sk-***" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "请描述视频中的场景、人物行为和主要事件。"
},
{
"file_data": {
"mime_type": "video/mp4",
"file_uri": "https://example.com/video.mp4"
}
}
]
}
]
}'
响应示例
{
"candidates": [
{
"content": {
"parts": [
{
"text": "该视频展示了一个人在室内进行演示。视频开头出现了主要场景,随后人物开始操作设备,并对过程进行说明。关键事件包括:场景介绍、设备展示、操作步骤演示以及结尾总结。"
}
],
"role": "model"
},
"finishReason": "STOP"
}
]
}
使用建议
- 如果需要让模型定位细节,可以在提示词中明确要求时间点、动作、对象或场景变化。
- 对较长视频进行分析时,建议将问题拆分为总结、事件提取、人物行为识别等多个任务。
- 如果希望获得稳定的结构化结果,可以要求模型以 JSON、表格或固定字段格式返回。