API 目录

视频理解

POST
/v1beta/models/gemini-2.5-pro:generateContent

视频理解

使用 Vortap 的 Gemini 兼容接口,可以向模型提交视频、图片、文本等多模态内容,并让模型围绕视频内容进行分析、总结、问答或提取结构化信息。

接口地址

POST https://www.vortapapi.com/v1beta/models/gemini-2.5-pro:generateContent

查询参数

名称类型必填说明
keystringVortap API Key,例如 sk-***

请求头

名称必填说明
Content-Type固定为 application/json

请求体

请求体使用 JSON 格式,通过 contents 字段传入对话内容。视频可以通过文件 URI、内联数据或已上传文件引用的方式提供,具体取决于你的接入方式。

示例:基于视频提问

{
  "contents": [
    {
      "parts": [
        {
          "text": "请总结这个视频的主要内容,并列出关键事件。"
        },
        {
          "file_data": {
            "mime_type": "video/mp4",
            "file_uri": "https://example.com/video.mp4"
          }
        }
      ]
    }
  ]
}

请求示例

curl -X POST "https://www.vortapapi.com/v1beta/models/gemini-2.5-pro:generateContent?key=sk-***" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "请描述视频中的场景、人物行为和主要事件。"
          },
          {
            "file_data": {
              "mime_type": "video/mp4",
              "file_uri": "https://example.com/video.mp4"
            }
          }
        ]
      }
    ]
  }'

响应示例

{
  "candidates": [
    {
      "content": {
        "parts": [
          {
            "text": "该视频展示了一个人在室内进行演示。视频开头出现了主要场景,随后人物开始操作设备,并对过程进行说明。关键事件包括:场景介绍、设备展示、操作步骤演示以及结尾总结。"
          }
        ],
        "role": "model"
      },
      "finishReason": "STOP"
    }
  ]
}

使用建议

  • 如果需要让模型定位细节,可以在提示词中明确要求时间点、动作、对象或场景变化。
  • 对较长视频进行分析时,建议将问题拆分为总结、事件提取、人物行为识别等多个任务。
  • 如果希望获得稳定的结构化结果,可以要求模型以 JSON、表格或固定字段格式返回。