推特等公司要价太高 OpenAI和Cohere等AI公司转向合成数据快讯

IT之家 2023-07-20 11:17
分享到:
导读

已使用合成数据来训练 AI 模型,Gomez 表示合成数据可以适用于很多训练场景,合成数据(synthetic data)是通过计算机技术人工生成的数据。

IT之家 7 月 20 日消息,人工智能公司 Cohere 首席执行官 Aiden Gomez 近日透露,由于 Reddit、Twitter 等公司的数据采集要价太高,包括微软、OpenAI 和 Cohere 在内的 AI 公司,已使用合成数据来训练 AI 模型。

Gomez 表示合成数据可以适用于很多训练场景,只是目前尚未全面推广。

IT之家在此附上 Gomez 举的一个例子:如果某个企业想在高等数学中训练一个模型,可以创建两个人工智能模型,分别扮演老师和学生的角色,并让它们讨论三角学之类的话题。人工主要负责观察,如果看到有什么错误,可以进行纠正。

IT之家注:

合成数据(synthetic data)是通过计算机技术人工生成的数据,而不是由真实事件产生的数据。

但合成数据具备“可用性”,能够在数学上或统计学上反映原始数据的属性,因此可以作为原始数据的替代品来训练、测试并验证大模型。
 

数据 合成 训练 公司 Gomez
分享到:

1.TMT观察网遵循行业规范,任何转载的稿件都会明确标注作者和来源;
2.TMT观察网的原创文章,请转载时务必注明文章作者和"来源:TMT观察网",不尊重原创的行为TMT观察网或将追究责任;
3.作者投稿可能会经TMT观察网编辑修改或补充。