100 美元 AI 音乐视频:Claude Fable 5 对决 GPT-5.6 Sol
Hacker News 摘要原标题:$100 AI Music Video: Claude Fable 5 vs. GPT-5.6 Sol
这篇文章来自 TryAI 博客,记录了一场让 AI 自主创作音乐视频的对决。实验者给 Claude Fable 5 和 GPT-5.6 Sol 提供了相同的歌曲(Bruno Mars 的 "Uptown Funk")、预设预算、网页搜索权限以及本地 ffmpeg 工具,让它们自主担任导演制作音乐视频。
实验设置
每个模型都运行在一个自主工具调用循环中,拥有六种工具:
• plan:用于思考,无成本。
• web_search:研究视频生成模型及其 API,获取音乐视频信息。
• get_budget:查看剩余预算。
• generate_image 和 generate_video:唯一消耗预算的工具。模型可以自主选择 FAL 或 Replicate 上的任何模型并设置参数。
• run_command:使用本地 shell 运行 ffmpeg 或 ffprobe,用于分析音频、剪辑、合并片段及合成最终视频。
实验共进行了四次尝试,两个模型分别在 25 美元和 100 美元两种预算下运行。系统为它们提供了歌曲、简短文本描述和带有时间戳的歌词。
核心数据对比
所有四次运行都成功生成了完整的音乐视频:
• Claude Fable 5(25 美元预算):耗时约 39 分钟,生成了 54 个视频片段,实际生成花费 24.30 美元,输出分辨率为 720p。
• GPT-5.6 Sol(25 美元预算):耗时约 43 分钟,生成了 61 张图片和 46 个视频,实际生成花费 23.18 美元,输出分辨率为 720p。
• GPT-5.6 Sol(100 美元预算):耗时约 50 分钟,生成了 70 个视频,实际生成花费 36.57 美元,输出分辨率为 720p。
• Claude Fable 5(100 美元预算):耗时约 39 分钟,生成了 80 个视频,实际生成花费 48.60 美元,输出分辨率为 1080p。
创作策略差异
模型在工具选择上表现出明显的分歧:
1. 生成路径:除了 25 美元档位的 GPT-5.6 Sol 采用了“先生成关键帧图片再转视频”的模式,其他三次运行均直接采用“文本转视频”模式。
2. 模型偏好:Claude Fable 5 倾向于在单次运行中只使用一种模型(如 Wan 2.5 或 Seedance 1.0 Pro)。而 100 美元档位的 GPT-5.6 Sol 则混合使用了 Wan 2.5、Veo 3.1 Lite 和 Hailuo 2.3 Standard 三种不同的视频模型。
3. 编辑技巧:GPT-5.6 Sol 被认为是最有创意的剪辑师,它在 25 美元档位的尝试中加入了文字叠加和带视频效果的动画,而其他运行版本大多只是简单地拼接片段。
成本分析
总成本包含生成费用和模型本身的 token 费用。Claude Fable 5 的 token 成本非常高,在 100 美元预算运行中,token 费达到了 25.05 美元。相比之下,GPT-5.6 Sol 的 token 费用仅在 3 到 4 美元左右。
实验发现与不足
尽管模型能够独立完成任务,但结果仍存在明显短板:
• 一致性缺失:人物和故事情节在不同镜头间缺乏连贯性,角色形象经常发生漂移。
• 歌词理解过于字面化:例如歌词提到“让龙都想退休”,画面中就真的出现了一条龙,缺乏艺术处理。
• 节奏感不强:虽然剪辑点能对准节拍,但画面内的动作(如跳舞、相机移动)往往与歌曲节奏不匹配。
• 缺乏自我审查:模型通常在生成片段后直接合并,很少回头重新剪辑或因为质量问题重新生成。
• 预算利用率:即便给出了 100 美元预算,模型也没有完全花完,说明它们目前的策略还比较保守。
该项目的完整代码已在 GitHub 开源。TryAI 表示,虽然目前的视频水平还不算完美,但观察 AI 如何自主决策、研究工具并处理长程任务的过程非常有意义。
原文:https://www.tryai.dev/blog/ai-music-video-arena-claude-vs-gpt-5.6