100 美元 AI 音乐视频:Claude Fable 5 对决 GPT-5.6 Sol

100 美元 AI 音乐视频:Claude Fable 5 对决 GPT-5.6 Sol

Hacker News 摘要

原标题:$100 AI Music Video: Claude Fable 5 vs. GPT-5.6 Sol

这篇文章来自 TryAI 博客,记录了一场让 AI 自主创作音乐视频的对决。实验者给 Claude Fable 5 和 GPT-5.6 Sol 提供了相同的歌曲(Bruno Mars 的 "Uptown Funk")、预设预算、网页搜索权限以及本地 ffmpeg 工具,让它们自主担任导演制作音乐视频。

实验设置

每个模型都运行在一个自主工具调用循环中,拥有六种工具:

• plan:用于思考,无成本。

• web_search:研究视频生成模型及其 API,获取音乐视频信息。

• get_budget:查看剩余预算。

• generate_image 和 generate_video:唯一消耗预算的工具。模型可以自主选择 FAL 或 Replicate 上的任何模型并设置参数。

• run_command:使用本地 shell 运行 ffmpeg 或 ffprobe,用于分析音频、剪辑、合并片段及合成最终视频。

实验共进行了四次尝试,两个模型分别在 25 美元和 100 美元两种预算下运行。系统为它们提供了歌曲、简短文本描述和带有时间戳的歌词。

核心数据对比

所有四次运行都成功生成了完整的音乐视频:

• Claude Fable 5(25 美元预算):耗时约 39 分钟,生成了 54 个视频片段,实际生成花费 24.30 美元,输出分辨率为 720p。

• GPT-5.6 Sol(25 美元预算):耗时约 43 分钟,生成了 61 张图片和 46 个视频,实际生成花费 23.18 美元,输出分辨率为 720p。

• GPT-5.6 Sol(100 美元预算):耗时约 50 分钟,生成了 70 个视频,实际生成花费 36.57 美元,输出分辨率为 720p。

• Claude Fable 5(100 美元预算):耗时约 39 分钟,生成了 80 个视频,实际生成花费 48.60 美元,输出分辨率为 1080p。

创作策略差异

模型在工具选择上表现出明显的分歧:

1. 生成路径:除了 25 美元档位的 GPT-5.6 Sol 采用了“先生成关键帧图片再转视频”的模式,其他三次运行均直接采用“文本转视频”模式。

2. 模型偏好:Claude Fable 5 倾向于在单次运行中只使用一种模型(如 Wan 2.5 或 Seedance 1.0 Pro)。而 100 美元档位的 GPT-5.6 Sol 则混合使用了 Wan 2.5、Veo 3.1 Lite 和 Hailuo 2.3 Standard 三种不同的视频模型。

3. 编辑技巧:GPT-5.6 Sol 被认为是最有创意的剪辑师,它在 25 美元档位的尝试中加入了文字叠加和带视频效果的动画,而其他运行版本大多只是简单地拼接片段。

成本分析

总成本包含生成费用和模型本身的 token 费用。Claude Fable 5 的 token 成本非常高,在 100 美元预算运行中,token 费达到了 25.05 美元。相比之下,GPT-5.6 Sol 的 token 费用仅在 3 到 4 美元左右。

实验发现与不足

尽管模型能够独立完成任务,但结果仍存在明显短板:

• 一致性缺失:人物和故事情节在不同镜头间缺乏连贯性,角色形象经常发生漂移。

• 歌词理解过于字面化:例如歌词提到“让龙都想退休”,画面中就真的出现了一条龙,缺乏艺术处理。

• 节奏感不强:虽然剪辑点能对准节拍,但画面内的动作(如跳舞、相机移动)往往与歌曲节奏不匹配。

• 缺乏自我审查:模型通常在生成片段后直接合并,很少回头重新剪辑或因为质量问题重新生成。

• 预算利用率:即便给出了 100 美元预算,模型也没有完全花完,说明它们目前的策略还比较保守。

该项目的完整代码已在 GitHub 开源。TryAI 表示,虽然目前的视频水平还不算完美,但观察 AI 如何自主决策、研究工具并处理长程任务的过程非常有意义。


原文:https://www.tryai.dev/blog/ai-music-video-arena-claude-vs-gpt-5.6

评论:https://news.ycombinator.com/item?id=48939524

Report Page