Doubao-Seed-2.1-pro
回答最长,对细节分析最多;同时也最倾向认为七喜瓶里装的是私酒。
先确认原视频和相同的前置提示词,再对照四份完整结果。暂时推荐 Doubao-Seed-2.1-pro 和 Gemini 3.1 Pro:前者负责画面与结构,后者补足声音分析。
原视频:在 TikTok 查看
本次样例只输入原视频和同一份前置提示词,没有另外上传图片。项目本身支持拆解图片或视频;本次选择视频,是因为视频同时包含画面、声音和时间变化,比单张图片更复杂,也更能代表多模态分析能力。
先用六个小块了解它要求模型做什么,需要复跑时再展开完整原文。
正在加载…
注意:我们能确认四个模型使用了相同的视频和前置提示词。模型原文里出现的“抽帧”或“关键帧”,指平台可能从视频内部提取的画面,不是另外上传的图片;平台是否把同样的声音内容交给每个模型,仍不能确认。
暂时选择 Doubao-Seed-2.1-pro 和 Gemini 3.1 Pro。Doubao-Seed-2.1-turbo 与 Doubao-Seed-Evolving 暂不作为首选。
回答最长,对细节分析最多;同时也最倾向认为七喜瓶里装的是私酒。
速度和完整度比较均衡,对听不到的声音大多写成“无法确认”;但后面仍有少数说得太肯定的地方。
最早开始、最早结束,也提出了两种不同解释;但它说自己听到了原始声音,这与另外两个模型的说法不一致。
明确表示收到完整视频与可用原音轨,覆盖 34.7 秒全片。声音信息较完整;但首轮没有通过最新版运行时契约,不能当作链路最终通过结果。
除了文风,更重要的是看它们有没有把猜测说成事实。
| 维度 | 2.1-pro | 2.1-turbo | Seed-Evolving 基于 20260714 | Gemini 3.1 Pro |
|---|---|---|---|---|
| 它说自己收到了什么 | 只有视频画面,没有原始声音 | 只有视频画面,没有原始声音 | 说自己能清楚听到原始声音 | 压缩后的完整时长视频与可用原音轨,能听到吞咽声和咳嗽声 |
| 它认为视频在讲什么 | 外来者慢慢懂得当地不公开的做法,最后变成熟悉规则的人 | 外来者逐渐发现公开说法和实际情况不同,最后可能找到了私下渠道 | 同时保留“适应无酒生活”和“找到私酒”两种解释 | 外来者从天真游客变成掌握灰色生存技能、分享违禁品的局内人 |
| 有没有把猜测说得太肯定 | 有些地方把“很可能”写得接近事实 | 大部分比较谨慎,后面仍有少数说得太确定 | 解释比较开放,但声音部分是否可靠需要先确认 | 有分证据等级,但仍包含外貌身份推断、未经核验的文化结论和投放建议,因此未通过最新版运行时契约 |
| 适合怎么用 | 暂时选择:画面、结构和创意方法主底稿 | 暂不作为首选,仅作速度参考 | 暂不作为首选,仅作不同解释参考 | 暂时选择:补足 Doubao-Seed-2.1-pro 缺少的声音和声画关系分析 |
页面展示四份完整原文,方便回看测试过程;暂时选择 Doubao-Seed-2.1-pro 和 Gemini 3.1 Pro。Gemini 展示的是首轮 MM01 原始结果,并附有运行数据与未通过最新版运行时契约的说明。