基于阿里云 Milvus 构建短剧生产平台--生图生视频与内容搜索实践
作者:周弘懿(锦琛)
业务背景
AIGC 短剧、竖屏微短剧、品牌短视频正在成为内容供给侧增长最快的赛道之一。和传统影视工业不同,这类内容的生产节奏极快:一个团队一周要产出几十条甚至上百条成片,每条成片背后又有大量关键帧、分镜、候选素材需要生成和筛选。典型的生产链路可以拆成四段:
分镜文案:编剧或运营先写出一段一段的分镜脚本,例如"雨夜,女主撑伞站在便利店门口,暖色灯光打在脸上"。关键帧生图:把分镜文案转成一张张关键帧图片,作为镜头的视觉锚点;有时还要在已有素材上做背景替换、风格迁移、参考图融合。
图生视频:把选定的关键帧作为首帧,用图生视频模型生成几秒的运动镜头;文生视频则直接从文案生成概念短片。
素材沉淀与检索复用:每天产生的图片、视频素材数量巨大,如果只是堆在对象存储里,下次要"找一段雨夜便利店的空镜"只能靠人肉翻文件夹。真正让素材变成资产的,是多模态内容理解 向量检索:给素材自动生成标题、描述、标签,把图片和视频都转成向量入库,之后就能以文搜图、以图搜视频、以文搜视频。
这条链路的业务价值:
内容生产提效:分镜文案到关键帧、关键帧到运动镜头都由模型批量完成,把人从重复劳动里解放出来,只保留创意和复核环节。素材资产沉淀:所有生成物带着结构化描述和向量入库,形成可检索、可复用的素材库,而不是一次性消耗品。
二次创作检索复用:新剧本里出现"复古咖啡馆"的镜头需求时,先在历史素材库里语义检索一遍,能复用的直接复用,不能复用的再走生成,边际成本持续下降。
技术挑战
如果不借助统一的向量数据库平台,自己从零对接各家生成模型、再拼一套检索系统,会撞上一连串工程痛点:
生图/生视频模型接入分散:文生图、图生图、文生视频、图生视频、视频编辑往往是不同的服务、不同的鉴权、不同的返回格式,业务代码里塞满各家 SDK 和 HTTP 客户端,维护成本高。异步任务管理复杂:视频生成是典型的长耗时异步任务,创建只拿到 task_id,要不断轮询查询状态。自己管理任务队列、轮询退避、终态判定、超时兜底很容易写错——比如把客户端本地超时误判成服务端失败并无限重试。
内容安全审核:AIGC 生成结果具有非确定性,肖像、品牌、版权都有合规风险,需要在生成环节引入审核与人工复核,不能盲目自动发布。
生成素材缺乏统一检索入口:图片存 OSS、视频存 OSS、描述文本存业务库、向量又单独存一套向量引擎,四份数据割裂,检索时要跨系统拼装。
多模态检索难、复用靠人工:以文搜图、以图搜视频这类跨模态检索,需要把文本、图片、视频映射到同一向量空间;没有语义检索时,运营找素材靠文件名和记忆,历史素材利用率极低,大量生成物变成沉没成本。
整体流程
整条流水线由四个 Milvus AI Function 串成,按"先生成、后检索"分为两个阶段、五个步骤:
四个 AI Function 的分工:
函数
作用
AI_IMAGE_EDIT
图像生成 / 编辑,支持单图编辑和多参考图融合
AI_VIDEO_EDIT
图生视频 / 文生视频,异步任务(video_edit 创建、tasks/describe 轮询)
AI_MULTI_MODAL_GENERATE
多模态内容理解,为图片 / 视频自动生成标题、描述、标签
AI_EMBEDDING
写入即向量化,把文本 / 图片 / 视频映射到同一向量空间
具体AI Function用法参考官方文档
实战操作
下面按流水线顺序讲解五个步骤的目标与要点;为便于对照,所有可运行代码统一集中在文末的「完整示例代码」一节。
阶段一 · 生成
步骤 1:关键帧生图(AI_IMAGE_EDIT / wan2.7-image)
目标:拿一张分镜参考图(或素材图),按分镜文案做背景替换 / 风格调整,产出一张关键帧图片 URL,作为后续图生视频的首帧。AI_IMAGE_EDIT 同步返回,单图输入用 texts,编辑指令写在 params.prompt。
输入:参考图 URL 分镜文案(prompt) → 输出:关键帧图片 URL。
步骤 2:图生视频(AI_VIDEO_EDIT / happyhorse-1.1-i2v)
目标:把关键帧作为首帧(media.type=first_frame)生成一段运动镜头。视频生成是异步任务:先 POST /v2/vectordb/ai/video_edit 创建拿到 task_id,再 POST /v2/vectordb/ai/tasks/describe 轮询,直到 task_status 变为 SUCCEEDED(拿到 video_url)或终态 FAILED / CANCELED。
输入:首帧图 运镜文案 → 输出:运动镜头 video_url(720P / 5s)。
步骤 3:素材理解,生成标题 / 标签(AI_MULTI_MODAL_GENERATE / qwen3.7-plus)
目标:在素材入库前,用多模态大模型给图片 / 视频生成一句客观的检索描述,作为标题、简介或标签来源。图片用 media_type=image,视频用 media_type=video,prompt 必填。这一步产出的 caption / tags 会随素材一起在步骤 4 入库。
输入:图片 / 视频 URL → 输出:标题、描述、标签。
阶段二 · 检索
步骤 4:多模态向量入库(AI_EMBEDDING 写入 / qwen3-vl-embedding)
目标:建一个"写入即向量化"的多模态素材 Collection(is_multimodal=true、dim=2560)。把图片 URL、视频 URL 连同标题、标签写入,Milvus 会自动为素材生成 2560 维向量并落库。图片和视频共享同一向量字段和同一模型,才能在同一空间里跨模态检索。
输入:步骤 1~3 产出的 urlcaptiontags → 输出:落库的 2560 维向量。
步骤 5:内容搜索——以文搜图 / 以文搜视频 / 以图搜视频(AI_EMBEDDING 查询)
目标:素材入库后,用同一个多模态模型把查询(文本或图片 URL)映射到同一向量空间,检索最相似的素材实现复用。由于 Collection 绑定了 qwen3-vl-embedding 的 Function,search 的 data 里直接传原始文本或媒体 URL,Milvus 会自动向量化查询。把查询文案换成一张图片 URL,同一个 search 调用即可完成"以图搜图 / 以图搜视频";去掉 filter 则在图片和视频混合库里跨模态检索。
输入:查询文本 / 查询图片 URL → 输出:Top-K 最相似素材(可用 filter 限定模态)。
完整示例代码
将MILVUS_HOST和MILVUS_TOKEN替换成自己的集群就可以直接看到效果
实战效果
依次跑通 入库 → 检索 → 重排等步骤。下图是一次完整运行的真实控制台输出:
上图是这条流水线一次完整跑通的输出:从一张分镜参考图出发,AI_IMAGE_EDIT 产出关键帧图片 URL,AI_VIDEO_EDIT 以关键帧为首帧异步生成运动镜头 video_url,AI_MULTI_MODAL_GENERATE 为图片与视频各生成一句检索描述,随后连同 URL、标签一起写入多模态 Collection(写入即向量化),最后以文搜图 / 以文搜视频 / 以图搜视频三路检索都能召回刚入库的素材并带出相似度分数。
这条「生成 → 检索」链路之所以能一次跑通、且结果可复用,关键在三点:
生成即入库:关键帧、运动镜头连同标题、描述、标签一起落库,每个生成物都带着结构化信息和向量,而不是用完即弃的一次性产物。同一向量空间:图片和视频共享同一个 qwen3-vl-embedding 模型与同一向量字段,才能在一个 Collection 里做以文搜图、以图搜视频这类跨模态检索。
写入即向量化、查询即推理:应用侧无需自己调 embedding,写入时 Collection Function 自动生成 2560 维向量,search 里直接传原始文本或媒体 URL 即可完成召回。
与自己从零对接各家生成模型、再拼一套检索系统相比,简化非常直观:
维度
传统自建方案
阿里云 Milvus 一站式
生成模型接入
文生图 / 图生图 / 文生视频各家 SDK、鉴权、返回格式分散对接
AI Function 统一封装生图 / 生视频 / 内容理解
异步任务管理
自建任务队列、轮询退避、终态判定与超时兜底
tasks/describe 标准轮询接口,终态判定清晰
素材理解
自建或外接标题、描述、标签服务
AI_MULTI_MODAL_GENERATE 内置多模态理解
向量化链路
应用侧先调 embedding 再写入
写入即向量化(Collection Function 自动生成)
检索入口
图片 / 视频 / 文本 / 向量四份数据割裂,跨系统拼装
单库单次 search 跨模态检索
总结
本文用四个 Milvus AI Function 把 AIGC 短剧生产的完整链路串成一条「生成 → 检索」流水线:
生成:AI_IMAGE_EDIT 把分镜文案变成关键帧;AI_VIDEO_EDIT 用创建 tasks/describe 轮询的异步模型把关键帧变成运动镜头;AI_MULTI_MODAL_GENERATE 让每个素材自带标题和描述。检索:AI_EMBEDDING(多模态 qwen3-vl-embedding)把图片和视频统一映射到同一向量空间,写入即向量化、查询即推理,实现以文搜图、以图搜视频、以文搜视频的跨模态检索。
它的价值不只是"生成快",更在于把每一次生成都沉淀为可检索、可复用的素材资产,让内容团队从一次性消耗走向资产化经营。
让 AI 落地,不必再从复杂链路开始
阿里云 Milvus 是目前唯一支持 AI Native 的 Milvus 云服务。它不仅提供高性能、全托管的向量检索能力,更将 AI Function 与 AI-Gateway 原生嵌入数据链路,让模型能力真正成为数据库的一部分。
从数据进入阿里云Milvus 的那一刻起,理解、加工、检索和生成便可以在一条原生链路中完成。阿里云 Milvus 正在把“接入 AI”变成“原生拥有 AI”。
-
08.13
# #WorkBuddy# 你的笔记存了上千条,为什么还是不会用?从校稿规则自学习说起
-
08.13
基于阿里云 Milvus 构建智能驾驶视频处理与分析实践
-
08.13
AI全知道 - 测试人员应该了解的Embedding Model知识结构
-
08.13
NVIDIA开放世界模型如何加速物理AI发展
-
08.13
NetApp收购JetStream Software,强化AI时代数据保护能力
-
08.13
NVIDIA Alpamayo 2 Super开放推理模型现已商用
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏