访谈
Denas Grybauskas,Oxylabs 首席治理和战略官 – 采访系列

Denas Grybauskas 是 Oxylabs 的首席治理和战略官,Oxylabs 是全球领先的网络情报收集和高级代理解决方案提供商。
Oxylabs 成立于 2015 年,提供世界上最大的道德来源代理网络,跨越 195 个国家,拥有超过 177 万个 IP 地址,以及 Web Unblocker、Web Scraper API 和 OxyCopilot 等高级工具,OxyCopilot 是一种将自然语言转换为结构化数据查询的 AI 驱动的抓取助手。
您在立陶宛的法律技术领域有着令人印象深刻的法律和治理经验。是什么个人动机让您在 Oxylabs 的角色中解决人工智能最两极分化的挑战之一 – 道德和版权问题?
Oxylabs 一直是行业中负责任创新的大旗手。我们是第一个倡导道德代理来源和网络抓取行业标准的公司。现在,随着人工智能的快速发展,我们必须确保创新与责任相平衡。
我们认为这是人工智能行业面临的一个巨大问题,我们也看到了解决方案。通过提供这些数据集,我们使人工智能公司和创作者能够就公平的人工智能开发站在同一立场上,这对所有相关人员都有益。我们知道保持创作者的权利在前沿和提供内容以用于未来的人工智能系统的开发是多么重要,所以我们创建了这些数据集,以满足当今市场的需求。
英国正在进行一场激烈的版权之战,双方都有强烈的声音。您如何解释人工智能创新和创作者权利之间的当前辩论状态?
虽然英国政府优先考虑有利于技术创新的法律框架很重要,但创作者应该感到人工智能能够增强和保护他们的权利,而不是窃取他们的作品。目前正在讨论的法律框架必须在促进创新和保护创作者之间找到平衡点,我希望在接下来的几周内,他们能够找到一种方法来实现这种平衡。
Oxylabs 刚刚推出了世界上第一个道德 YouTube 数据集,该数据集需要创作者同意用于人工智能训练。这个同意过程是如何工作的?它在其他行业(如音乐或出版)中是否具有可扩展性?
数据集中数百万个原始视频都获得了创作者的明确同意,用于人工智能训练,通过道德手段连接创作者和创新者。Oxylabs 提供的所有数据集都包括视频、转录和丰富的元数据。虽然这些数据有许多潜在的用例,但 Oxylabs 专门为人工智能训练准备了这些数据,这也是内容创作者明确同意的用途。
许多技术领袖认为,要求所有创作者明确同意可能会“扼杀”人工智能行业。您如何回应这一说法?Oxylabs 的方法如何证明了这一点?
要求对所有用于人工智能训练的材料都需要事先明确同意,这将带来重大的运营挑战,并将对人工智能创新产生重大成本。相反,保护创作者的权利,这可能会无意中激励公司将开发活动转移到执法更宽松或版权法规不同的管辖区。然而,这并不意味着没有中间立场可以在人工智能开发的同时尊重版权。相反,我们需要可行的机制来简化人工智能公司和创作者之间的关系。
这些数据集提供了一种前进的方法。内容可以在未经版权所有者明确选择退出的情况下使用的退出模型是另一种方法。第三种方法是通过技术解决方案(如在线平台)促进出版商、创作者和人工智能公司之间的交易。
最终,任何解决方案都必须在适用的版权和数据保护法律范围内运作。在 Oxylabs,我们相信人工智能创新必须以负责任的方式进行,我们的目标是为尊重创作者的同时促进创新而做出贡献的法律和实用框架做出贡献。
您的团队在使基于同意的数据集可行时面临的最大障碍是什么?
YouTube 启用内容创作者轻松许可其作品用于人工智能训练,为我们铺平了道路。之后,我们的工作主要是技术性的,涉及收集数据、清理和结构化数据以准备数据集,并为公司访问所需数据建立整个技术设置。但这也是我们多年来一直在做的事情。当然,每个案例都有其自身的挑战,特别是当您处理像多模态数据这样复杂的事情时。但我们既有知识,也有技术能力来做到这一点。因此,一旦 YouTube 作者有机会给予同意,剩下的只是投入时间和资源的问题。
除了 YouTube 内容外,您是否设想了一个未来,其他主要内容类型(如音乐、写作或数字艺术)也可以被系统地许可用于训练数据?
我们已经指出,为了使人工智能创新与创作者权利相平衡,需要系统地进行许可和内容许可。只有当两方都有方便和合作的方式来实现目标时,才能实现互利。
这只是开始。我们相信,在各个行业提供这样的数据集可以提供一种解决方案,最终使版权辩论得到和平解决。
像 Oxylabs 的道德数据集这样的产品的重要性是否会根据 EU、英国和其他管辖区的人工智能治理方法而有所不同?
一方面,基于明确同意的数据集的可用性为那些基于在更严格监管的管辖区的人工智能公司提供了平等的竞争机会。这些公司的主要问题不是他们不关心同意,而是没有便捷的方式来获得同意,他们将因此而落后。
另一方面,我们相信,如果获得用于人工智能训练的数据许可被简化,就没有理由这个方法不能成为全球首选。我们的基于许可的 YouTube 内容的数据集是朝着这种简化迈出的一步。
随着公众对人工智能训练方式的不信任日益增长,您如何认为透明度和同意可以成为科技公司的竞争优势?
虽然透明度通常被视为对竞争优势的障碍,但它也是我们对抗不信任的最强武器。人工智能公司可以提供的透明度越多,就有越多的证据表明人工智能训练是道德和有益的,从而重建对人工智能行业的信任。反过来,创作者看到他们和社会可以从人工智能创新中受益,就会有更多的理由在未来给予同意。
Oxylabs 经常与数据抓取和网络情报相关联。这个新的道德计划如何融入公司的整体愿景?
发布道德来源的 YouTube 数据集继续了我们在 Oxylabs 的使命,即建立和推广行业的道德实践。作为这一使命的一部分,我们联合创立了道德网络数据收集倡议(EWDCI),并推出了代理来源的首个透明分层框架。我们还推出了 Project 4β,以使研究人员和学者能够最大限度地发挥他们的研究影响力,并增强对关键公共网络数据的理解。
展望未来,您认为政府应该为训练数据强制执行默认同意,还是应该让行业自愿推动这一举措?
在自由市场经济中,通常最好让市场自我纠正。通过允许创新应对市场需求,我们不断地重塑和更新我们的繁荣。只有在所有其他途径都已用尽,无法确保在允许创新发展的同时维护正义时,才应诉诸严厉的立法。
在人工智能训练方面,似乎我们还没有达到这一点。YouTube 的许可选项和我们的数据集表明,该生态系统正在积极寻找适应新现实的方法。因此,虽然明确的监管是必要的,以确保每个人都在其权利范围内行事,但政府可能希望谨慎行事。与其要求每次都需要明确同意,不如研究行业如何开发机制来解决当前的紧张局势,并在立法鼓励创新而不是阻碍创新时以此为参考。
您会给那些希望优先考虑道德数据使用而不阻碍创新的人工智能初创企业和开发者什么建议?
初创企业可以通过开发简化同意过程和为创作者带来价值的技术解决方案来帮助促进道德数据使用。随着获取透明来源数据的选项出现,人工智能公司不必在速度上做出妥协;因此,我建议他们保持警惕,寻找这样的选项。
感谢您接受这次精彩的采访,希望了解更多的读者可以访问 Oxylabs。












