已故英国作家道格拉斯·亚当斯最为人熟知的作品是1979年出版的《银河系漫游指南》 。但关于亚当斯,他的事迹远不止维基百科条目所记载的。无论你是否想知道他的星座是双鱼座,或者世界各地的图书馆都用同一串数字(13230702 )来存储他的书籍,只要你前往维基媒体基金会中一个被忽视的角落——维基数据(Wikidata),你就能知道。

在那里,与亚当斯相关的图像、文本、关键词和其他信息既存储在网页中,也存储在我们当中的机器人为机器设计的格式中,如JSON。

现在,维基数据 (Wikidata) 正在构建一个全新的 AI 友好型数据库,使大型语言模型能够更轻松地提取信息。该数据库来自维基媒体基金会德国分会(Wikimedia Deutschland)的维基百科嵌入项目,该项目负责监管维基数据。这支位于柏林的团队在过去一年中,使用大型语言模型将维基数据中的 1900 万条条目从笨重的结构化数据转换为能够捕捉维基数据条目上下文和含义的向量。

在这种矢量格式中,信息最好被想象成一个由点和相互连接的线组成的图形——亚当斯将与“人类”以及他的书名联系在一起,维基数据投资组合负责人莉迪亚·平切尔 (Lydia Pintscher) 告诉The Verge。

虽然前端用户体验将保持不变——项目负责人表示,维基百科不会变成聊天机器人——但后端将变得更容易访问,以便人工智能开发人员使用数据构建自己的聊天机器人。

Pintscher 表示,该项目的目标是为科技巨头之外的 AI 开发者提供公平的竞争环境。OpenAI 和 Anthropic 等公司拥有对维基数据进行矢量化的资源,就像 Pintscher 和她的团队所做的那样。规模较小的机构最能从访问维基数据库中精选数据的新途径中受益。“对我来说,这真的是为了给他们优势,至少给他们一个机会,对吧?” Pintscher 说。

她以Govdirectory为例,该项目充分利用了维基数据中由志愿者整理的海量数据。该平台允许用户查找世界各地政府官员的社交媒体账号和电子邮件。

大多数人工智能聊天机器人会优先考虑互联网上的热门词汇和话题。Pintscher 表示,除了帮助 Little Tech 获得优势之外,该团队还希望更容易访问维基数据,从而让人工智能系统能够更好地反映互联网上尚未被广泛提及的小众话题。例如,这可能是将信息输入 ChatGPT 的更好方法,而不是“生成大量内容,然后等待 ChatGPT 下次重新训练,而且它可能会(也可能不会)考虑你的贡献”,Pintscher 说道。

Wikidata AI 项目经理 Philippe Saadé 告诉The Verge,实际上,这些向量将允许 AI 系统更好地访问信息本身以及信息周围的上下文。

该团队使用了人工智能公司 Jina AI 的模型,将维基数据截至 2024 年 9 月 18 日的结构化数据转换为向量。IBM 旗下的 DataStax 目前免费为该项目提供存储向量数据库的基础设施。

该团队正在等待使用该数据库的开发人员的反馈,然后再使用过去一年新增的信息进行更新。虽然当前的数据库并未包含过去一年新增的全新信息,但萨德表示,对现有维基数据进行细微的编辑或调整不会削弱数据库的实用性。“归根结底,我们计算的向量就像是对某个项目的总体概念,因此,如果在维基数据上进行了一些细微的编辑,其相关性不会太高,”他说道。

https://www.theverge.com/news/789288/wikidata-ai-friendly-database