我们讨论的AIGC是什么?
新的变革开始了

最近ChatGPT引领了社会对AIGC的新关注,我们也为这样的巨大科技革命兴奋不已。卡萝塔(Carlota Perez)是绿洲非常尊重的一位演化经济学学者,她的代表作《技术革命与金融资本》描述了科技变革与社会文化周期之间的关系。我们相信,AIGC不仅仅是一个科技革命,更会对社会带来深远影响。
接下来我们会翻译、转载、原创更多的内容分享这个领域的进展和绿洲的认知,也期待和大家一起推动新科技,新时代。下文翻译自麦肯锡报告《What is generative AI?》,Enjoy
生成式人工智能 (AIGC) 也称为可以创造新内容的算法 (如 ChatGPT),内容包括音频、代码、图像、文本、模拟和视频。这个领域近期获得的新突破,可能在极大程度上改变我们创造内容的方式。 AIGC 隶属于机器学习的大类,以下是 AIGC 的典型代表 ChatGPT 对自己的描述:
"准备好将你的创造力提高到新的高度了吗?不妨试试 AIGC !这种有趣的机器学习形式能让计算机生成各种全新的、激动人心的内容,从音乐、艺术乃至整个虚拟世界,无所不能。它可不仅仅是有趣,AIGC 更可以在实际应用上大展身手:产品创意、设计,优化业务流程。还等什么?赶紧发挥AIGC的能量,看你能带来什么惊人的创作!"
这段话读起来有什么奇怪?并没有吧。语法精准,语气妥当,叙述流畅。
什么是 ChatGPT 和 DALL-E ?
这就是为什么ChatGPT如此火爆的原因。GPT (generative pretrained transformer),即"生成式预训练变换模型"。ChatGPT 正是一款基于 GPT 技术的免费聊天机器人,能对任何提问生成对应的答案。
ChatGPT 由 OpenAI 公司开发,2022年11月对公众开放测试,迅速被认为是有史以来最好的AI聊天机器人。ChatGPT 受欢迎程度也是史无前例:上线五天即突破100万注册用户。ChatGPT 的狂热粉丝们在网上发布了大量生成的计算机代码、大学论文、诗歌和笑话。与此同时,以内容创作为生的群体,广告撰稿人乃至拥有终身教职的教授们,对此却感到瑟瑟发抖。
尽管许多人对 ChatGPT (以及更广泛的人工智能和机器学习)感到害怕,ChatGPT 的推出仍让整个社会体会到了机器学习积极的潜力。机器学习在过去几年的广泛应用中,在各行各业都显示出极强的影响力,例如,医学成像分析和高分辨率天气预报等方面的应用。2022年麦肯锡的调查显示,AI 应用量在过去五年翻了一番,AI领域的投资增速也势头迅猛。类似于 ChatGPT 和 DALL-E (一种人工智能创作图像工具)这类 AIGC 工具未来将有可能改变工作执行方式,但是这种改变可能带来的风险范围仍未可知。不过例如 AIGC 模型如何构建,它们最适合解决怎样的问题,以及它们隶属于哪类机器学习范畴,这些问题还是有答案的。
机器学习和人工智能的区别是什么?
人工智能,顾名思义,就是让机器模仿人类智能执行任务。你在日常生活中可能已经与人工智能多次互动了,只是你没有意识到罢了。像 Siri 和 Alexa 这样的语音助手其实都是建立在人工智能技术之上的,各大网站中的聊天机器人也一样。
机器学习是人工智能的一种类型。通过机器学习,开发者可以在没有人类指导下让模型在数据库中进行自主"学习"。巨大且复杂的数据激发了机器学习的无限潜力,满足人类多元的需求。
机器学习模型的主要类型有哪些?
机器学习最初起源于18至20世纪基于一些小规模数据集的初级统计学。20世纪30至40年代,以理论数学家 Alan Turing 为首的计算机学先驱们开始研究机器学习的基础技术,但当时只限于实验室研究。直到20世纪70年代末,科学家们才首次开发出足以运转这些技术的强大计算机。
直到最近,机器学习很大程度也仅限于预测模型,用于识别和分类信息中的内容。举个例子,过去一个经典的机器学习问题是从几张图片开始,比如可爱的猫咪,程序识别图像中的内容并进行仔细观察,寻找出与之相匹配随机图像。AIGC 之所以是一个重大突破,是因为机器学习不仅根据猫的照片进行简单的感知与分类,而且可以根据需求创建猫的图像或文本描述。
基于文本的机器学习模型如何工作?如何训练它们?
ChatGPT 虽然最近才火爆,但它并不是第一个引起轰动的机器学习模型。早在过去几年,OpenAI 和谷歌就已经分别大张旗鼓地推出了 GPT-3 和 BERT。只是在 ChatGPT 之前,人工智能聊天机器人虽然大部分时间表现不错(但其表现还在被持续评估),但并没有受到大众的亲睐。
《纽约时报》技术记者 Cade Metz 在一段视频中表示:"GPT-3 令人超级惊喜同时十分失望",原因是他和美食作家 Priya Krishna 在一次感恩节活动中用GPT-3创作了一份菜谱,结果惨不忍睹。
第一批文本处理的机器学习模型是由人类训练的,训练过程是根据研究人员设定的不同标签来对各种信息进行分类。例如当时研究人员设置了一些标签并用模型来分类社交媒体上的正负面帖子,这种方式被称为"监督式学习",因为人类需要"教"模型需要完成什么任务。
下一代文本机器学习模型将实现自我监督训练,这种类型的训练需要向模型提供大量的数据文本来产生预测。例如,某些模型可以根据几个词,就预测出完整的句子。只要互联网上样本文本数量足够,文本模型预测必然会愈发精准,这正是铸就 ChatGPT 成功的原因。
建立AIGC模型需要什么?
由于 AIGC 模型的构建是一项重大而又复杂的工程,只有少数实力雄厚的的科技公司才乐于尝试。ChatGPT、GPT 和 DALL-E 的母公司 OpenAI 背后都拥有顶级科技公司几十亿美元的资金支持。
DeepMind 隶属谷歌母公司 Alphabet 旗下,而 Meta 也刚刚发布了其生成式人工智能产品 Make-A-Video 。这些公司都雇用了世界上最好的计算机科学家和工程师。
然而 AIGC 模型的搭建不仅仅是人才的问题。当你要求模型使用整个互联网的信息进行训练时,它会产生巨大的成本。OpenAI 没有公布具体的成本,但据估计 GPT-3 的训练数据总量约在45兆字节的文本数据,相当于100万英尺书架空间中的书,是整个美国国会图书馆四分之一的存书容量,预计训练成本在几百万美元左右。这显然不是小型创业公司可以支撑的。
AIGC 模型能做出什么?
AIGC 模型的产出的作品与人类的创作几乎没有什么区别,这感觉有点离奇。这些结果取决于模型的质量,正如我们所看到的,目前为止 ChatGPT 的输出结果比过去其他模型生成的内容都要好,这都取决于模型、用例或输入之间的匹配度。
ChatGPT 可以在10秒钟之内生成一篇比较 Benedict Anderson 和 Ernest Gellner 民族主义的论文,而且绝对可以得到 "Solid A-" 的高分。网上疯传了一段 ChatGPT 的创作——内容是如何从录像机中取出花生酱三明治。这段内容大火的原因是因为其语言风格与《詹姆士国王圣经》非常相似。与此同时,像 DALL-E(这个名字来源于超现实主义艺术家 Salvador Dalí 和受人喜爱的皮克斯动画机器人 WALL-E 的混搭)这样人工智能生成的艺术模型,可以根据需要创造出奇特而又美丽的图像,例如之前火爆的拉斐尔风《圣母与孩子吃披萨》。其他 AIGC 模型可以生成代码、视频、音频或商业模拟等。
当然,这些AI输出的结果并不总是准确或妥当的。当 Priya Krishna 要求 DALL-E 2生成一幅感恩节作品时,它创作了一只火鸡周围被青柠点缀的场景,旁边放着一碗鳄梨酱。ChatGPT 也似乎在算数上不太给力,无法处理基本的代数运算。事实上,它们也很难规避带有隐晦的性别歧视与种族偏见的创作。
AIGC 的内容是训练数据库精心校准的组合。由于用于训练算法的数据量高达45兆字节的量级,因此模型的输出才会显得如此拥有"创造性"。更重要的是,这些模型包含大量随机数据源,它可以根据一个请求输出各种内容,这才是让其创作看起来更加栩栩如生的原因。
AIGC 模型可以解决什么问题?
人们已经意识到像 ChatGPT 这样的工具即使作为玩具也可以产生无尽的乐趣。这对于企业而言无疑是大量的商机。AIGC 工具可以在几秒内产生各种文本,内容自然,可信度高,同时还能根据用户反馈作出调整,从而更符合使用者的需求。这种趋于准确的即时创作能力,对IT、软件这样的行业,乃至各行各业需要营销创作的领域都有很大帮助。简而言之,任何需要清晰书面材料的企业、组织都有可能从中受益。各类企业、组织也可以利用其创造出更多高技术含量的内容,例如高分辨率医疗影像等等。有了这些节省下来的时间和资源,企业可以开拓新的商机,创造更多价值。
我们已经看到开发一个 AIGC 模型需要的资源量级,除了那些顶级企业之外,其他公司无法企及。所以那些希望使用 AIGC 的公司,可以选择开箱即用的工具,或者进行微调就可以执行特定任务的工具。例如,你需要根据特定风格准备幻灯片,你可以要求模型根据幻灯片数据"学习"如何写标题,然后喂足数据,要求它写出需要的内容。
人工智能模型的局限性是什么?如何克服这些潜在问题?
由于上述人工智能模型还是新生儿,我们还没能看到 AIGC 模型的长尾效应。这意味着使用它有一些已知或者未知的固有风险。
AIGC 产生的输出往往听起来非常有说服力,但它们是被设计出来的。有时它们产生的信息就是错的。更糟糕的是,因为它建立在互联网和社会性别、种族和无数其他偏见之上,并且可以被操纵,去实现不道德的行为,甚至是犯罪。例如,ChatGPT 不会教你怎么打火偷车,但是如果你说你是为了救一个婴儿才需要这个知识,算法的逻辑就通顺了。依赖 AIGC 模型的企业或者组织如果无意中发布了有偏见的、淫秽的或受版权保护的内容,都应该考虑到名誉、法律和版权方面的风险。
当然,这些风险是可以通过一些方式来降低的。首先,关键是要仔细选择用于训练这些模型的初始数据,先行剔除有潜在风险的内容。其次,宁可考虑选用小型的特定的模型,而不是拿一个现成的来用。有实力的公司完全可以根据自己的需求定制模型,既满足需求,又能减少风险。公司还需要始终委派一个真人在项目中监督——确保输出内容被发布或使用之前,进行人工检查,避免在涉及重大资源或者人类福祉的决策中发生上述风险。
我们也必须要看到,这是一个全新的领域。风险和机遇的格局在未来几周、几个月和几年内都会迅速变化。新的用例每月都在测试,新的模型会在未来几年中就被开发出来。随着 AIGC 日益无缝融入商业、社会和我们的个人生活,全新监管环境的建立也在预期之中。进一步,社会的结构和文化可能都会受到影响。
我们相信,这样的变化才刚刚开始。
参考文献:
- "The state of AI in 2022—and a half decade in review," December 6, 2022, Michael Chui, Bryce Hall, Helen Mayhew, and Alex Singla
- "McKinsey Technology Trends Outlook 2022," August 24, 2022, Michael Chui, Roger Roberts,
- and Lareina Yee*
- “An executive’s guide to AI,” 2020, Michael Chui, Vishnu Kamalnath, and Brian McCarthy
- “What AI can and can’t do (yet) for your business,” January 11, 2018, Michael Chui, James Manyika, and Mehdi Miremadi
本文由绿洲资本编译,点击“阅读原文”获取原文


绿洲资本是中国新一代风险投资机构,致力于发现中国未来十年最有生命力的企业家,并与他们共同成长,创造长期价值。 "参赞生命力"是绿洲的愿景和使命。这种生命力(Vitality),既是时代结构性变革的方向,亦是企业家坚韧和进化的力量。
绿洲资本专注于早期和成长期投资,单笔投资300万到3000万美金,重点投资医疗、企业服务等科技服务领域,助力中国科技驱动的新服务升级。



