AI 实验室在“鹈鹕骑自行车”上作弊了吗?
Simon Willison4 天前
“鹈鹕骑自行车”曾被用作一个相当不严谨的图像生成模型测试:如果模型能否正确画出一只鹈鹕骑自行车,似乎可以反映它在组合概念、动物结构和交通工具细节上的能力。
一个有趣的问题随之出现:既然这个测试被反复提及,AI 实验室会不会已经针对它做了专门训练,让模型在这个特定提示词上表现得更好?这种做法被戏称为“pelicanmaxxing”。
最近有人对此做了一次更系统的检查。测试设计如下:
- 选取 8 种动物 和 6 种交通工具,组合成 48 个提示词;
- 每个提示词在每个模型上运行 3 次;
- 测试覆盖 7 个模型:GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Pro;
- 之后使用 GPT-5.6 Luna 和 Gemini 3.1 Flash-Lite 辅助评估结果。
测试关注的问题包括:
- “鹈鹕骑自行车”的图像是否明显更好;
- 模型是否更擅长画鹈鹕;
- 模型是否更擅长画自行车;
- 在考虑难度差异后,鹈鹕与自行车的组合是否仍然异常突出;
- 相关图像是否看起来像被记忆或背诵出来的结果。
结论是:在这组测试模型中,没有找到明显证据表明存在针对“鹈鹕骑自行车”的专门优化。
测试结果显示,鹈鹕并没有比其他动物画得更好,自行车也没有比其他交通工具画得更好。更重要的是,没有哪个模型在“鹈鹕 + 自行车”这个组合上的表现,显著超出它本身画鹈鹕和画自行车的能力所能预测的范围。
其中 GLM-5.2 的表现最接近“异常”:它在“鹈鹕骑自行车”这一格上的提升最大,第一张样例也比较引人注意。但这个效果很小,并且不具有显著性,因此不宜过度解读。
这项测试的价值不在于证明某个模型好或坏,而在于展示了一种更稳妥的评估思路:当一个基准测试被广泛传播后,如果怀疑模型可能针对它进行了优化,就应该用相邻任务、组合任务和对照组来检查结果是否真的异常。
