外观
AI 视频生产工作流项目专项面试题
目录
1. 使用说明
- 对应知识主题:AI 视频生产工作流项目主文档与实战问题与增长篇;
- 角色:资深面试官从端到端生产阶段追问到可恢复媒体平台,高级技术应聘者负责讲清时间线、副作用、版本、质检与证据边界;
- 回答顺序:先用 1~3 句专业短答,再用生活化解释;项目必须按设计、实现、测试、实测和个人贡献分别陈述;
事实红线| 不写死任何供应商当前模型能力或限制;接入前按目标供应商、模型、区域和版本核对官方文档、策略及实际响应;
- 题目数量:7 题,严格覆盖 L1~L7。
阅读图例|
L1~L2概念与边界 ·L3~L4原理与实现 ·L5工程 ·L6架构 ·L7项目复盘答案层级| 必答结论 · 小白解释 · 加分项 · 高频误区 · 下一问
2. 递进路线
图:AI 视频生产工作流项目 L1~L7 递进路线
替代文本: L1 端到端阶段 → L2 自动化/人工/授权边界 → L3 纯语音时间线与口播一致性 → L4 持久工作流与数据模型 → L5 首轮可用率与无穿帮拼接 → L6 平台档案与模型路由 → L7 投放转化与证据化复盘。
图表加载中…
读图结论: 蓝色阶段建立概念与边界,紫色阶段进入原理与实现,橙色和青色阶段验证工程与架构能力,绿色阶段用项目证据完成复盘。
题链先把单次视频 API 调用提升为完整生产系统,再深入媒体时间、跨系统副作用和镜头依赖,最后要求明确区分设计方案与真实实现证据。
图:镜头状态、按问题类型局部返工与人工交付门禁
替代文本: 每个镜头以 shot_id 独立经历 READY、GENERATING 和 ASSET_READY;供应商提交结果不明时进入 SUBMISSION_UNKNOWN 与 RECONCILING 对账,不能盲目重提。合格镜头依次进入音画对齐、字幕与时间线、低清预览渲染和质量门禁;失败后先定位问题类型及依赖范围,画面或生成资产问题回到镜头生成,配音版本或音画漂移回到音画对齐,字幕或时间线问题回到字幕/时间线,画幅、字体、编码或渲染配置问题回到预览渲染,不能把所有失败统一退回整片或镜头创建。
图表加载中…
读图结论: 局部返工必须先分类再沿依赖图回到最小必要节点:生成问题回镜头生成,音画问题回对齐,字幕/转场问题回时间线,渲染配置问题回预览渲染;不能把一次失败等同于整片重跑。
镜头状态和项目交付状态不能混为一谈:单个镜头 ASSET_READY 只表示该资产可进入音画对齐,不代表成片可发布;SUBMISSION_UNKNOWN 必须先对账,不能用自动重试赌一次重复扣费。质检失败后要用资产哈希、时间区间和时间线依赖判定最小失效集合:只有画面、人物、动作或源资产问题才重做对应镜头;配音与音画漂移、字幕与时间线、编码与渲染问题分别从各自节点恢复,其他上游资产保持冻结复用。版权、肖像、声音等高风险事项仍必须由人工门禁作最终决定。
3. 一问一答
第 1 题|L1 概念|AI 视频生产系统包含哪些阶段,为什么不能等同于一次视频生成调用?
核心考察点|端到端项目边界、镜头粒度和交付闭环
面试官提问
请从输入到交付完整描述,并指出最小生产与返工单元。
30 秒专业短答
完整链路是需求规范化、结构化脚本、角色与分镜、镜头资产生成、配音/音乐/字幕、统一时间线、低清预览、技术与语义质检、局部返工、高清渲染、发布和归档。镜头
shot_id是生成、质检、成本和返工的共同最小单元;模型调用只是素材生产的一环,不能替代状态、媒体合成、授权和交付验收。
小白解释
拍电影不是按一次“生成”按钮,而是先定剧本和分镜,再拍每个镜头、配音、剪辑、审片和交付;某个镜头出错应重拍这一镜,而不是整部电影从头再来。
- 合格线| 覆盖规划、素材、音频字幕、时间线、质检、返工与发布;
- 加分项| 低清预览后高清、版本化中间产物和失败镜头的依赖失效;
- 高频误区| 项目介绍只说调用某个视频模型,或把“生成完成”当“发布成功”;
- 下一问| 生产阶段明确后,继续划分 AI 自动化、确定性程序、人工审核和授权责任。
第 2 题|L2 边界|哪些环节适合 AI 自动化,哪些必须由代码、人工和授权门禁控制?
核心考察点|概率生成、确定性执行、人类责任与多层合规门禁
面试官提问
请覆盖脚本建议、事实、版权肖像声音、供应商能力和外部发布。
30 秒专业短答
LLM/VLM 可辅助脚本、分镜、Prompt、素材与语义质检,FFmpeg/状态机负责确定性时间线、编码、状态和规则校验;事实、高风险内容、品牌、版权、肖像与声音授权需要可信来源和人工责任。业务授权、供应商当前能力/政策、目标平台发布规则是三个独立门禁,任一失败都不应付费提交或发布;具体限制必须按目标版本官方文档核对,不能用旧经验写死。
小白解释
AI 像创意助理,可以写脚本和挑镜头,但法务签字、演员授权、设备能不能拍和电视台能不能播是四套不同检查;有演员同意也不代表某台设备或平台一定允许。
- 合格线| AI 建议不等于授权,业务/供应商/发布门禁分离;
- 加分项| 能力矩阵、授权范围/有效期、策略版本、人工签署和发布审计;
- 高频误区| 业务取得授权后就绕过供应商政策,或让模型自行批准发布;
- 下一问| 边界明确后,深入脚本、分镜、旁白和转场如何落到一条确定性时间线。
第 3 题|L3 原理|只有最终语音没有 Timeline,且口播、字幕或口型不一致,怎么处理?
核心考察点|音频驱动时间线、VAD/ASR/Forced Alignment、口播问题分类和证据化校验
面试官提问
请给出从纯语音恢复镜头时间线的调用链,并区分文案—语音、语音—字幕和语音—口型三类不一致。
30 秒专业短答
我先用 ffprobe 获取最终音频的真实时长、采样率和起始时间,再做 VAD;有准确脚本时直接 Forced Alignment,无脚本时先 ASR 再词级对齐,按停顿、语义和最长镜头时长生成整数毫秒的
timeline.json,低置信数字、专有名词和 CTA 转人工。口播问题分三层:文案与语音用 Canonical Script、ASR 回译和关键术语 Diff;语音与字幕用最终音频重新对齐;语音与口型只在正面中近景按需使用 Lip Sync,并做双嘴、遮挡、A/V Sync 和人工验收。
小白解释
剪辑师只拿到录音时,会先听出哪里说话、每句话什么时候结束,再把画面和字幕钉上去;台词说错、字幕晚半拍和嘴形对不上是三种病,不能都靠把字幕拖一拖解决。
- 合格线|
ffprobe → VAD → ASR/Forced Alignment → timeline.json,并能说清三类口播不一致的修复节点; - 加分项| CER 之外为价格/品牌/型号设零容忍关键术语门禁,记录音频、对齐模型和时间线版本,首中尾及切镜点复核;
- 高频误区| 用字数估时冒充最终 Timeline,或用 Wav2Lip 掩盖 TTS 已经读错内容;
- 下一问| 时间线恢复后,长任务仍需要持久状态、幂等副作用和版本化素材才能可靠执行。
第 4 题|L4 实现|如何设计持久工作流、状态机和核心数据模型?
核心考察点|业务事实源、可靠启动、外部调用状态和资产依赖
面试官提问
请覆盖事务 Outbox、Workflow ID、ProviderCall 对账态和素材版本。
30 秒专业短答
API 短事务原子写入
VideoJob与 Outbox,Dispatcher 以workflow_id=job_id和明确的重复/复用策略幂等启动持久工作流,同一 ID 对应不同业务意图必须拒绝。Outbox 与 Activity 都可能重复投递或重试,因此每个可重试 Activity 和外部副作用步骤都必须绑定稳定业务意图,优先使用供应商原生幂等 Token;结果不确定时进入SUBMISSION_UNKNOWN/RECONCILING对账,不能承诺跨系统 exactly-once。Shot管理最小工作单元,Asset记录内容哈希、来源和授权,TimelineVersion保存依赖,状态迁移使用版本或条件更新抵抗重复、乱序回调。
小白解释
前台先在同一本账里登记订单和“需要开工”的消息,后台按订单号只启动一条生产线;每个镜头、素材和剪辑表都有版本,外包厂是否已接单不清楚时单独挂“待核对”,不能再随手下单。
- 合格线| Job+Outbox 原子写、稳定 Workflow ID 与重复策略、所有可重试 Activity 的幂等/对账、ProviderCall 未知态和版本化资产;
- 加分项| Webhook 验签/去重/乱序、轮询兜底、对象存储转存、缓存 Canonical JSON 和依赖传播失效;
- 高频误区| 请求中双写数据库与工作流,或直接复制供应商状态作为内部状态;
- 下一问| 数据模型建立后,继续处理供应商超时、重复费用、镜头局部失败和媒体质量验收。
第 5 题|L5 工程|如何提高“抽卡率”,并让镜头拼接平滑、没有穿帮?
核心考察点|指标口径、失败分类、生成前连续性约束、媒体边界和成本权衡
面试官提问
这里把抽卡率定义为首轮镜头可用率。请说明如何计算、定位下降原因,以及转场为什么不能解决所有穿帮。
30 秒专业短答
首轮镜头可用率等于首轮无需重生成的合格镜头数除以首轮生成总数,我会同时看单个合格镜头成本、平均生成次数、人工挑选时间和按失败原因拆分的拒绝率。提升手段包括分镜可执行性检查、角色/商品参考资产、短镜头、首尾帧、按镜头类型路由、低成本探索后精修和风险分层的动态 Best-of-N。拼接则先用
continuity_state约束人物位置、动作、道具、光线和运动方向,再统一分辨率、帧率、Time Base、色彩与音频;硬切、Match Cut、J/L Cut、xfade/acrossfade只处理适合的边界,人物或道具状态错误必须重生成。
小白解释
不是多抽几张卡就一定划算,要统计为什么废片、每张合格卡花了多少钱。两段视频加淡化像给接缝刷漆,但上一镜手里有杯子、下一镜杯子消失,刷漆也遮不住,只能重拍或换镜头。
- 合格线| 明确定义首轮可用率,能按失败类型定位,并区分叙事连续性、生成连续性和媒体连续性;
- 加分项|
shot_type/model_version/prompt/reference/seed/reject_reason数据维度、边界 QC、剪辑余量和固定回归镜头集; - 高频误区| 固定生成大量候选却不核算成本,或对所有切镜统一使用 Crossfade;
- 下一问| 镜头质量可控后,还要解决不同平台位置和不同模型能力持续变化的问题。
第 6 题|L6 架构|每个平台规格不同、视频模型也不断变化,系统如何选型与适配?
核心考察点|Placement Profile、受控模型横评、镜头路由、发布前校验和降级
面试官提问
请以 YouTube Shorts、TikTok、Meta Reels 等为例,说明为什么不能维护一个“通用竖屏参数”,以及 Sora、Veo、Runway、Firefly、Seedance/即梦、可灵该怎么比较。
30 秒专业短答
平台约束应按
platform + placement + ad_type + region + policy_version建立PlatformProfile,记录画幅、分辨率、时长、文件、Codec、音频、字幕、安全区、CTA、授权和 AI 标识;无水印母版按 Profile 派生,发布前再用当前后台/API 做硬校验。模型不能做静态排行榜,我会在相同分镜、参考素材、时长、画幅、预算和审核标准下比较 Prompt 遵循、一致性、运动、原生音频、延迟、失败率、首轮可用率、单个合格镜头成本、API 与合规,再按镜头类型路由并保留备用供应商。
小白解释
同一家电视台的开屏、信息流和短视频广告也可能有不同尺寸和时长;摄像机也各有所长。正确做法是按节目位置准备交付清单,再用同一批样片试拍,不是听说某台机器“最强”就包办所有镜头。
- 合格线| Platform Profile 精确到广告位/类型,模型在固定条件下横评并按镜头路由;
- 加分项| 动态政策版本、发布前契约测试、模型 Scorecard、Fallback、预算和队列/Worker 隔离;
- 高频误区| 把
1080×1920当所有平台的充分条件,或引用精选 Demo 直接宣布模型胜负; - 下一问| 最终还要回答:这些视频用于什么业务,如何证明它们提高了转化而不是只增加播放。
第 7 题|L7 项目复盘|AI 视频如何用于投放引流并提高转化?当前项目能证明到什么程度?
核心考察点|业务目标、创意实验、漏斗归因、增量价值和证据边界
面试官提问
以“游戏高光时刻剪辑用于赛事或游戏下载引流”为例,给出非技术的业务闭环,并说明当前仓库证据能否支持“提高了转化率”的结论。
30 秒专业短答
游戏高光素材的价值不是自动剪出更多击杀,而是把“事件价值、叙事上下文、人群和 CTA”组合成可验证的引流假设。我会分别为拉新下载、老玩家召回和赛事进房设计素材,用同一人群、出价、时段和落地页做小流量实验,再按有效观看、点击、下载或进房、单位结果成本和增量逐层判断;高点击低进房要查开播状态、落地承接和人群,不能继续归因给剪辑模型。当前仓库只有设计与业务演练,没有真实投放、对照组、成本或转化数据,因此只能说设计了验证闭环,不能声称已经提升转化。
小白解释
AI 像快速拍广告的团队,可以一次试多个开场和卖点;但广告有人看不等于有人买。要用同样的人群和预算做公平小测试,还要检查落地页是否兑现视频承诺,最后才能判断钱花得值不值。
- 合格线| 业务场景、创意假设、漏斗定位、对照/增量意识和当前证据边界;
- 加分项| 单变量实验、样本不足时标记不显著、创意疲劳、毛利后回收、合规与落地页一致性;
- 高频误区| 用播放量代替转化,用平台归因总量代替增量,或把文档方案包装成真实 ROAS 提升;
- 下一问| 本组题结束;下一步应先实现确定性时间线和镜头评测,再用小流量实验逐级增加技术与业务证据。
4. 自测与评分
- [ ] 画出需求到发布的阶段图,并标出人工和授权硬门禁;
- [ ] 从一段纯语音恢复词级时间、停顿和镜头锚点,并区分三类口播不一致;
- [ ] 为 Outbox、重复回调、
SUBMISSION_UNKNOWN和局部失效写状态测试; - [ ] 用固定镜头集比较两个模型的首轮可用率、拒绝原因和单个合格镜头成本;
- [ ] 为三个不同广告位设计 Placement Profile,并画出创意投放漏斗;
- [ ] 按准确性、原理深度、工程意识、项目表达、沟通结构各 0~5 分评分;
- [ ] 第 7 题不得把设计表、故障演练或规划指标包装成真实经历。
5. 事实边界与参考资料
- 单一事实源:AI 视频生产工作流项目主文档与实战问题与增长篇;
- 源文档依据包括视频供应商、YouTube Shorts、TikTok、Meta Reels、巨量引擎、WhisperX、MFA、Wav2Lip、FFmpeg/ffprobe、Temporal 与 OpenTelemetry 的官方资料或论文;
- 供应商模型、区域、输入类型、时长、分辨率、政策、幂等和查询能力会变化,接入时必须核对目标版本官方文档与实际响应;
当前无法确认| 项目代码、数据库、接口、测试、Trace、媒体产物、实测质量/延迟/成本、真实事故和个人实现贡献。
6. 总结
一句话记忆: AI 视频项目先用最终音频和镜头级工作流保证可交付,再用平台档案、模型路由和受控实验验证业务价值。
- 纯语音通过 VAD、ASR/Forced Alignment 恢复 Timeline,口播问题按文本、字幕时间和口型分类;
- Job+Outbox、ProviderCall 对账态和不可变资产版本支撑恢复与局部重算;
- 首轮镜头可用率必须和成本、拒绝原因一起看,转场不能修复叙事穿帮;
- 平台要求精确到 placement,模型用固定镜头集横评后按场景路由;
- 当前没有真实投放和转化证据,只能说明实验设计,不能声称已提升业务指标。