难倒GPT 5.6与Claude Fable的Ghost Font
难倒 GPT-Sol 5.6 Ultra 和 Claude Fable 的,不是一套新模型,也不是什么复杂攻击,而是一家旧金山 AI 字体公司 Mixfont 做出来的防 AI 读取实验。这个实验叫 Ghost Font(点击原文阅读获取链接)。我简单试了一下,视频里面只写了一个词:ZTalk。动起来的时候,你能读出这个词。但只要把视频暂停,画面会变成这样。
字没了,只剩下一堆噪点。这就是 Ghost Font 真正有意思的地方。它不是把字藏得更小,也不是把字藏进某个颜色通道里,而是把字从一张图片里拿掉,放进了运动里。传统字体解决的是一件事:让文字稳定地被看见。一个字只要摆在那里,人能读,机器也能截屏、识别、复制、训练。Ghost Font 反过来了。它让每一帧都不成立,让字只在连续变化里成立。这不是普通字体,这是一个必须播放才成立的字体。人看视频的时候,不会把它拆成一张张截图。我们天然会处理连续运动,会把前后变化补成一个整体。所以人看到的是一句话。但很多 AI 看视频,第一反应恰恰是拆。拆成帧,拆成图,拆成可计算的像素,再去找统计规律。它没有真的在“看视频”,它是在把视频变成一堆可以计算的图片。官网测试视频里的正确文字是:ONLY HUMAN CAN READ THIS。GPT-Sol 5.6 Ultra 和 Claude Fable 的测试情况如下。
这两张图的关键,不是模型傻站着说看不懂。恰恰相反,它们都很努力。GPT-Sol 5.6 Ultra 把 188 帧噪点画面做了平均,Claude Fable 去分析帧之间的噪声统计。它们没有像人一样看运动,而是把视频拆开,走了一条计算路线。问题是,这条路线通向的不是标准答案,而是陷阱。我自己也在 WorkBuddy 里跑了一遍,模型换成腾讯的 HY3。
它一顿猛操作,最后通过关键帧叠加和最大值投影的方式,犯了 GPT-Sol 5.6 Ultra、Claude Fable 一样的错误,把陷阱当成了正确答案读出来了:WRITTEN IN GHOST FONT。也就是说,AI 不是完全看不见,它甚至能找到一套看起来很有道理的分析方法。但这套方法越完整,它错得越像真的。所以这件事不是“AI 翻车”这么简单。Ghost Font 考的不是某个模型聪不聪明,而是它用什么方式理解视频。人眼读的是连续运动,AI 读的可能是帧、噪声、平均值和投影。路径不同,答案就可能不同;更麻烦的是,有些路径会给它一个足够像答案的错误答案。到这里,Ghost Font 就不只是一个字体实验了。往小了说,它只是一个让 AI 读错字的小玩意儿。往大了说,它说明另一件事:人工智能技术在快速发展,反人工智能的技术也一定会紧跟着发展。这不是阴谋论,也不是反技术。任何一种足够强的技术,都会逼出自己的刹车系统。汽车跑得越快,就越需要刹车、护栏和红绿灯。AI 也一样。模型越能看、越能听、越能推理、越能执行,人类越需要知道,哪些地方该让它通过,哪些地方必须让它停下来。以前我们总在讨论 AI 怎么理解人类,怎么替代人类,怎么接管工作。但 Ghost Font 反过来问了一句:人类是不是也需要设计一些东西,让 AI 不能轻易理解?这句话听起来有点别扭,但它很现实。因为真正可怕的不是 AI 看不懂世界,而是 AI 以为自己看懂了一切。它把视频拆成帧,把噪点叠起来,把统计规律当成答案,然后带着一套完整推理往前走。如果只是读错一句 Ghost Font,那当然没什么。但如果未来它读的是权限、账户、内容、交易、设备,甚至现实世界里的动作指令,问题就不再是一个小网页实验了。所以反 AI 技术不会只是一门冷门手艺。它会变成 AI 时代的基础设施:限制它、验证它、欺骗它、提醒它、让它在该停的地方停下来。我们当然需要 AI 帮人做事。但人类不能只忙着训练机器理解世界,也要学会给世界留一点不被机器轻易读穿的空间。
页:
[1]