美情报界用新AI工具锁定视频拍摄地点

人工智能学家 · 经八阕原文

一段没有任何定位信息的短视频,一张模糊的照片,甚至只是一段夹杂着环境噪声的录音,AI能否在几分钟内告诉你,它是在地球上的哪个角落拍摄或录制的?美国情报界正在认真尝试回答这个问题。

据美国科普媒体《The Debrief》报道,美国情报高级研究计划局已悄然启动一个名为“LocUS”的研究项目,目标是开发一种人工智能系统,在5分钟内判断几乎任何视频、图片或音频的拍摄地点。

这听起来像是谍战电影里的情节,却正在一步步走进现实。

美国情报高级研究计划局成立于2006年,隶属于美国国家情报总监办公室,专门资助高风险、高回报的前沿研究。

一、目标:5分钟、250米

按照项目设定,这套系统需要在不依赖任何嵌入元数据的情况下,确定多媒体内容的拍摄或录制位置。

它的性能目标相当苛刻:90%的预测结果误差要控制在250米以内,而且要在5分钟内给出答案。搜索范围则可以大到约1550英里,相当于从北京到广州的直线距离还要更远一些。

这套系统需要同时处理视觉和听觉信息。画面中的建筑风格、植被、道路标识和地形,都可能成为线索;而环境中的鸟鸣、车流声、方言广播等声音,同样能透露地点信息。

更难的是,它必须能处理质量很差的素材,比如模糊的视频、低分辨率的图片和经过压缩的音频。无论室内还是室外,无论是一个街区还是整片大陆,系统都要能够应对。

而且,整个过程要在没有人工引导的情况下自主完成。

二、一场严格的技术竞赛

据报道,美国情报高级研究计划局于今年4月召开了项目提案人日会议,相关竞标已于6月截止。项目研发周期为15个月,期间将进行五次独立测试,大约每季度一次。

测试将使用参赛团队从未见过的隔离数据集,以确保系统的真实能力。参赛团队还必须提交容器化的软件和源代码。

值得注意的是,项目明确排除了人脸识别、声纹识别、生物特征识别等技术,也不接受只针对单一地区或单一地貌的系统。这意味着,研究人员必须让AI真正学会从环境本身“读懂”地点,而不是依赖识别特定人物。

三、用途与隐忧并存

按照官方说法,这项技术将主要用于打击人口贩卖、营救人质,以及支持情报和执法行动。

美国情报高级研究计划局首席副局长亚伦·卢卡斯表示,这些研究项目将帮助构建直接适用于任务需求的能力。

一些可能参与其中的研究人员背景也颇具代表性。美国圣路易斯大学的艾比·斯蒂利亚努博士参与建立的TraffickCam数据集,收录了超过1500万张酒店和出租房屋的图片,专门用于协助识别人口贩卖受害者照片的拍摄地点。

在人口贩卖案件中,受害者的照片往往拍摄于酒店房间,确定房间位置就可能成为解救受害者的关键线索。

北卡罗来纳大学教堂山分校的刘晓明博士则长期从事计算机视觉研究,关注模型在不同地理环境下的泛化能力。

事实上,该机构早在2011年至2016年就曾实施过一个名为“Finder”的类似项目,探索图像地理定位技术。

然而,这项技术引发的隐私担忧同样不容忽视。

如果任何一段视频都能被迅速定位,那么普通人在社交媒体上分享的生活片段,也可能暴露自己的住址和行踪。新闻记者、维权人士和冲突地区的平民,都可能因此面临新的风险。

四、开源情报的新时代

实际上,通过公开图像判断拍摄地点,早已是开源情报领域的一项重要技能。

过去,这项工作往往依靠经验丰富的分析人员,对照卫星地图、街景图像和各种细节线索,花费数小时甚至数天才能完成。而AI的加入,可能把这一过程压缩到几分钟,并实现大规模自动化处理。

类似的AI地理定位工具在学术界和商业领域也已出现,一些模型仅凭一张街景照片就能大致猜出所在国家甚至城市。

这既是情报工作效率的巨大飞跃,也意味着监控能力的进一步扩张。技术本身无所谓善恶,关键在于由谁使用、如何使用、受到怎样的约束。

对普通人来说,这项研究也提醒我们:在数字时代,分享每一张照片和每一段视频之前,或许都值得多想一想。

如何在公共安全与个人隐私之间划定边界,将是这类技术必须面对的长期考题。

来源:人工智能学家(经八阕转载) · 查看原文
Scroll for more