鹈鹕测智

一句「画一只骑自行车的鹈鹕」,同时压着动作理解、时序一致与空间关系,而且一眼能看出好坏。下面是提示词、合格线参照和逐条可勾的检查清单。

本地生成

合格线参照

本站手绘,不是模型生成

下面这条是本站用 SVG 手写的鹈鹕,作为对照用。它刻意做到了六项检查里的每一项 —— 尤其是腿和踏板:两者用的是同一个坐标函数算出来的,所以永远不会踩空。别人画的作品达不到这个水平时,差距一眼就能看出来。

难度:入门

提示词

社区统一提示词
原版 · Classic
加载中…

检查清单

对着作品逐条打勾
    当前档位原版 · Classic
    播放速度1×
    已勾检查项0 / 6

    常见问题

    鹈鹕测智这道题真的能测出模型强弱吗?

    不能当严格 benchmark 用,但很适合看短时间内的体感变化。题目公开且被反复用过,模型可能已经熟悉,所以它测不出绝对水平;它的价值在于——同一个提示词、同一个模型,你今天跑和上周跑,能一眼看出差别。社区里管这个叫体感温度计。

    看到一只鹈鹕就知道模型行不行,靠的是什么?

    看六处结构:两个轮子有没有真的在转、车架有没有跟着轮子一起转、鹈鹕的腿和踏板对不对得上、嘴和喉囊画不画、循环末尾跳不跳帧、以及前进是靠背景平移还是靠整幅画在飘。这六处每一处都对应一类结构错误,而且不需要懂代码就能看出来。

    为什么腿和踏板对不上是最明显的破绽?

    因为其它错误要盯着看很久才发现,这个看一眼就露馅。早期模型会把鹈鹕和自行车当成两个东西拼在一起,腿是画的、踏板是转的,两者各自独立动画,于是踏板转到哪腿都不跟,看着像踩空。它说明模型没有把「蹬踏板带动腿」这件事当成一条因果链来处理。

    页面里那只鹈鹕是模型画的吗?

    不是,是本页自己用 SVG 手写的,作为合格线的参照物。它的腿和踏板用的是同一个坐标函数算出来的,所以永远对得上——参照物自己不能犯这道题要测的毛病。打开辅助线能看到曲柄的垂直半径,脚就跟着这条线的端点走。

    这个页面会联网或上传我复制的东西吗?

    不会。提示词、检查清单和动画都写在随页面下发的脚本里,页面不发任何网络请求,也不会生成任何文件。你调过的速度与勾选的检查项只留在浏览器本地,方便下次打开接着用。

    为什么大家爱用一只鹈鹕来测模型

    大模型的跑分早就被针对性优化过了 —— 榜单上的分数越来越好看,体感却未必跟着变。社区于是转向另一类题:短到一句话、长到看不出深浅,但做得好不好一眼就能分出高下。「画一只骑自行车的鹈鹕」成了其中最出名的的一道。它不需要任何前置知识作门槛,判卷人只要看几秒钟动画:轮子转不转、车架会不会跟着转、腿和踏板对不对得上、循环末尾跳不跳帧。

    提示词只有一句

    「创建一个 HTML,内容是 SVG 绘制一个鹈鹕骑自行车的 2D 动画」。不给任何细节,看的是模型自己的判断。

    同时考四件事

    把动作拆成时序、把零件摆成空间关系、再用代码组织起来,最后还得让人一眼看懂。

    验收不用懂代码

    六项检查全是普通人能判断的视觉事实,不需要会读 SVG 就能给别人打分。

    同一提示词可反复跑

    题面不变,每隔一段时间跑一遍,差别就是模型状态的变化。

    失败形态很典型

    轮子不转、车架跟着转、腿踩空、鹈鹕画成鸭子,各自对应一类结构错误。

    不联网不上传

    提示词与清单都在页面里,复制走的是文本,不产生任何请求。

    三个最容易忽略的细节

    1. 一定要让它动起来。只看静态截图,上面六项检查里有四项都验不了 —— 轮子转没转、腿踩没踩空、循环跳不跳帧、背景在不在平移,全都要动起来才看得出来。很多人拿着一张截图说「画得挺好的」,那只能说明它交了一张图。
    2. 「2D 动画」这四个字不能省。提示词里省掉它,模型大概率给你一张静态的路径图 —— 结构对不对都无从判断,等于白测。
    3. 车架跟着转是最容易被放过的一条。整辆车包进一个旋转的组,轮子转得飞快,车架也在慢慢翻。不盯着看十几秒根本发现不了,但这条恰恰说明模型没有把车架和车轮当成两个独立的东西。