行业观察

Ghost Font:让 AI 看不懂的“反抓取字体”是怎么做出来的

一个叫 Ghost Font 的原型项目,把文字藏进由背景同色点组成的短视频,靠运动信息和诱饵文本让主流多模态模型无法识读真实内容,背后是屏幕时代 AI 抓取与人类隐私的新一轮攻防。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
Ghost Font:让 AI 看不懂的“反抓取字体”是怎么做出来的

有一种字体,人类一眼能看懂,AI 看了等于没看。这不是科幻设定,而是 GitHub 上叫 Ghost Font 的原型项目正在做的事。它把文字藏进视频,用运动、噪声和诱饵信息,让图像识别模型无从下手。

具体玩法是这样:用户输入一段文字,工具生成短视频。画面里的字母由和背景完全同色的点组成,单帧截图什么都看不到。要读出内容,必须看一段时间内点的位移规律——这正是人眼擅长、当前多数视觉模型不擅长的部分。

更狡猾的是,视频里还埋了一条诱饵文本。AI 按常规思路会先识别出诱饵,然后自信地交差。作者测试发现,把这种视频喂给几款主流多模态模型,即便允许写代码辅助,也读不出真正的运动信息,直到被点破背后用了什么招。

核心信息与背景

这个项目灵感来自 2013 年设计师 Sang Mun 的 ZXX 字体。ZXX 当年的口号也是“让人能读、让机器难读”,但十年过去,几代 OCR 和视觉模型已经把它的变形和纹理吃得差不多了。Ghost Font 的作者显然明白,单靠静态字形已经挡不住现在的模型。

为什么这件事在 2025 年又值得重新做?屏幕正在变成 AI 的主要输入,多模态大模型能直接“看”截图、视频通话和远程桌面,屏幕上的任何内容都可能成为模型抓取和训练的目标。反 OCR 不再是学术游戏,而是和隐私、版权直接相关的问题。

对内容创作者来说,Ghost Font 提供了一种新思路:与其把水印贴在画面上,不如让画面本身就对机器“隐身”。这在保护草稿、未公开剧本、内部素材等场景里可能有用。不过它目前只是本地原型,工具链和稳定性都还很早期。

对用户的影响与后续观察

对开发者社区,更值得注意的是它提到的两个延伸方向。一是把这种运动编码塞进下一代 CAPTCHA——人眼一滑就能验证,模型跑半天也读不出来;二是作为 AI 视觉感知基准,衡量模型能不能像人一样从时间序列里提取信号。这两项需求都是真实的。

但也要看到边界。Ghost Font 依赖视频,而多模态模型的视频理解能力正在快速补齐。今天读不出的视频,明年可能就被拿下。这种对抗更像军备竞赛,而不是一劳永逸的护栏。

后续值得观察几件事:作者计划开源视频生成代码,社区拿到后会很快把它和其他反 AI 抓取手段对比;CAPTCHA 方向有没有大厂愿意接走;主流基准是否会把这类素材纳入评测。这些决定 Ghost Font 是停留在极客玩具,还是真的进入产品视野。

AI 能看图之后,内容的“可见”和“可读”第一次被拆成两件事。Ghost Font 提醒我们:这件事比想象中复杂,也比想象中更早到来

同主题阅读路径

查看「行业观察」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具