#1227 2007 · reCAPTCHA (Luis von Ahn, Ben Maurer, Carnegie Mellon University) · Web security / digitization
reCAPTCHA 让每一次人机验证,顺便数字化一个电脑读不出的单词
问题
老旧扫描书籍上的文字已经模糊到软件读不出来,而每天却有数百万人在免费打字验证「我是人类」
背景
到 2000 年代中期,CAPTCHA——登录和注册页面上用来区分人类和机器人的扭曲文字——虽然解决了安全问题,却在浪费大量的人类注意力:帮助推广 CAPTCHA 的卡内基梅隆大学计算机科学家 Luis von Ahn 估算,全球每天要解答约 2 亿次 CAPTCHA,每次约 10 秒,合计每天超过 50 万人时,全都花在敲那些歪歪扭扭、一验证完就消失的字母上。与此同时,互联网档案馆和报纸出版商手里有几十万页扫描件,其文字光学字符识别(OCR)软件根本读不准:旧字体、洇墨、折痕都能难倒机器,而这些图像本身对人眼来说清清楚楚。
von Ahn 更早的项目 ESP Game 已经证明,游戏玩法可以把有用的标注,作为娱乐的副产品从玩家身上顺便提取出来。CAPTCHA 提供了同样机会的反面:人们已经在大规模、免费地付出这份劳动,只是它的产出——解出来的一个扭曲词——在验证完登录的瞬间就被扔掉了。
换别人会怎么做
当时可选的办法是按商业价格雇人手动转录那些认不出的词,但这没法扩展到几十万页的量级;要么就接受 OCR 软件的错误率,发布带瑕疵的数字文本。
他们看到了什么
安全验证和数据标注问的其实是同一个问题:认出一个扭曲的词。把 CAPTCHA 拆成两半,同样的十秒钟,在不知不觉中既验证了人类身份,也转录了档案。
那一手
von Ahn 和 Ben Maurer 打造了 reCAPTCHA:不再只显示一个扭曲词,而是两个——一个是系统能自行判分的已知验证词,另一个是扫描书籍或报纸页面里软件识别不出的真实单词。答对已知词证明你是人类;答出未知词——需要多个不同用户的答案相互印证才会被采纳——则把正确的转录结果反馈给数字化项目,于是那本来就要消失的十秒钟,现在干了两份活。
为什么管用
它之所以有效,是因为在原有 CAPTCHA 上多加一个词,对用户来说边际成本几乎为零——输入扭曲文字的这份麻烦,本来就被当作使用网站要付出的代价——而一个被正确转录的档案词,乘以每天数亿次的解答次数,价值就变得巨大。把每个未知词拿去和多个独立用户的答案交叉核对,就能把一次不可靠的单独猜测,变成统计意义上可信的转录结果,而且不需要信任任何一个单独的解答者。
值了多少
数字化了 1300 多万篇《纽约时报》文章,最早追溯到 1851 年,每年还为 Google 图书处理约 200 万本书;在 Google 停用它之前,全球超过 10 亿人解答过它。
什么时候会失灵
这套模式只有在附带任务真的和用户已经能忍受的任务一样简单时才有效——一旦更难,或者引发怀疑(后来人们开始琢磨自己到底在转录什么,reCAPTCHA 就越来越容易引发这种怀疑),完成率和好感度都会下降。它也有保质期:一旦机器视觉本身就能识别扭曲文字,安全验证的理由就不成立了,reCAPTCHA 只能被非文字的行为验证取代。
后来呢
reCAPTCHA 在近十年里成了整个网络上验证「你是人类」的标准组件,也确立了「人类计算作为副产品」这一公认的设计模式,直接启发了 von Ahn 后来创办的 Duolingo——用同样的思路,让学语言的人在练习时顺便翻译真实的句子。
资料来源
- [1]reCAPTCHA: Using Captchas To Digitize BooksTechCrunch, 2007techcrunch.com
- [2]reCAPTCHA (a.k.a. Those Infernal Squiggly Words) Almost Done Digitizing the New York Times ArchiveNewsweek, 2011newsweek.com