GTA 新出的游戏预告片看了吗?据说,这个预告片已经破了三项吉尼斯世界纪录,观看次数已经破亿。

但如果告诉你,AI 三巨头也可以成为 GTA 里的人物,你还能认出他们吗?

AI 三巨头:Yann LeCun、Geoffrey Hinton 和 Yoshua Bengio。
这张 GTA 风格的合照是腾讯用一个名为 FaceStudio 的 AI 模型合成的,其特点是人物辨识度非常高,把用途广泛的「AI 写真」技术又往前推了一步。
在人工智能技术迅速发展的今天,AI 写真照已经成为 AI 技术应用的一个热门方向。在 AI + 图像应用领域,妙鸭相机等 AI 写真产品已经展示了巨大的潜力和受欢迎程度。妙鸭相机的推出仅仅几周就在社交媒体上引起了广泛关注,其迅猛的增长速度凸显了这一市场的巨大潜力。尽管如此,众多 AI 写真产品在技术上还存在一定的局限性,例如用户需要上传多张差异较大的照片,并且需要等待较长时间才能获得合成效果,这无疑影响了用户体验。
在这个由 AI 主导的图像创新浪潮中,腾讯的最新研究成果 FaceStudio 显现出了更进一步的技术突破。这项研究不仅侧重于快速合成人像,而且更注重于保留人像的身份信息,从而在满足美观需求的同时,还能保持人物的唯一性和识别度。它不仅继承了开源算法 StableDiffusion 的核心优点,还在多个关键功能上进行了创新性改进。其中最引人注目的是其利用混合引导进行图像生成的能力,这一点着重体现在处理多人照片和风格化图像两个方面。
FaceStudio 的核心技术在于其能够在不牺牲个人身份特征的情况下,实现风格化的人物图像合成。传统的 AI 图像合成技术往往在追求视觉美感的同时,会牺牲人物的独特性和识别度。然而,FaceStudio 通过先进的混合引导机制,能够在生成图像时同时考虑文本提示、风格图像和身份图像,从而在保持个体特征的基础上实现多样化的风格转换。这不仅仅是技术上的一大突破,也为用户提供了更加丰富和个性化的图像合成选择。
此外,FaceStudio 独特的多身份交叉注意机制,使其在处理包含多个人物的图像时尤为出色。传统方法在处理此类图像时常常会遇到难以准确区分和维持每个人物特征的问题。但 FaceStudio 的这一机制可以准确地将不同身份的特征信息映射到图像的相应部分,无论是在保持每个人物的独特性,还是在整体风格的协调性上都表现卓越。

FaceStudio 支持多种人脸相关的有趣应用

论文地址:https://arxiv.org/abs/2312.02663
主页地址:https://icoz69.github.io/facestudio/
方法概述
混合引导设计
FaceStudio 的核心特性之一是其混合引导设计。该团队采用了一种独特的方法,允许模型同时接收图像和文本提示,从而生成具有特定身份特征的图像。基于图像提示的引导模块包含两个子模块:
图像引导模块:在这个部分,FaceStudio 使用 CLIP 视觉编码器来处理人类图像。这些图像通常是风格化的,含有丰富的视觉信息,如色彩、纹理和构图等。CLIP 编码器能够从这些图像中提取出复杂的风格特征。
身份识别模块:并行于图像引导模块,腾讯团队还设计了一个身份识别模块,这一模块使用 Arcface 模型来处理单独的面部图像。其主要目的是从面部图像中提取出关键的身份特征,如面部结构、表情和其他独特的生物识别信息。
在提取出风格化图像的视觉特征和面部图像的身份特征之后,这两组特征被融合在一起。这一步骤是通过一个线性层完成的,它将两种特征结合,创建一个综合的引导特征。这种方法的优点在于,它不仅能够保留人物的身份特征,还能够在图像生成过程中融入特定的风格和内容。
除了图像引导,FaceStudio 还集成了文本引导功能。这是通过使用一个预训练好的先验模型(PriorTransformer)实现的。这个先验模型能够将 CLIP 文本特征映射到对应的 CLIP 视觉特征。然后,同图像提示引导模块一样,这些视觉特征结合身份识别模块的特征,形成一个能够响应文本提示的综合引导特征。最终,这两种提示特征被加权融合,实现混合引导。

FaceStudio 的架构示意图
多人图像合成
在腾讯团队开发的 FaceStudio 框架中,“处理多人图像” 部分是一个关键创新,专注于在单个图像中合成多个人物肖像,从而使得每个人物在最终图像中都能保持其独特的身份。面对一个包含多个人物的图像,FaceStudio 采用了一种特殊的注意力机制。该机制确保在图像合成过程中,每个人物区域的特征都只访问与之对应的身份信息。这意味着模型能够精确地控制每个人物的身份特征,确保它们在最终图像中正确呈现。为了实现这种精确的控制,腾讯团队使用了人物实例分割模型。这个模型能够识别出图像中的不同人物,并将每个人物的区域与其对应的身份特征相关联。这样,模型就可以确保在合成图像时,每个人物的身份信息都得到了正确的引导。

FaceStudio 与基线算法的多人图像生成效果对比
训练策略
腾讯团队为 FaceStudio 设计了一种以人类图像重建为目标的训练策略。通过这种方法,他们使用遮盖面部区域的原始图像作为风格化的人类图像输入,同时使用相同图像中裁剪的面部作为身份输入。这样,模型能够在生成引导图像时,更准确地保留人物的身份特征。不同于已有的生成模型训练方式,这种方法只依赖于人像作为训练数据不需要文字标注,大大减轻了对标注数据的依赖。能够更好的泛化到各种风格的人像中。
结果展示
FaceStudio 通过评估人脸相似度和人像生成时间来展现其独特的优势。实验结果显示,FaceStudio 生成单个人像只需要不到 4 秒即可完成,而基于优化的热门算法 DreamBooth 则需要长达 6 分钟。同时 FaceStudio 更好地保留了人像特征,有着更好的人脸相似度。实验结果对比如下:

研究人员也在相同的图像上与当前最佳的人像生成模型算法进行比较。结果显示,FaceStuio 几乎在所有的样本上都达到了更好或者同级别的效果。这进一步展示了 FaceStudio 强大的鲁棒性和泛化性。比较结果如下:

此外,FaceStudo 的实验中还展示了多种独特的人脸图像生成应用,包括身份混合和文字图像混合引导生成。

身份混合图像生成实验

文字图像混合引导图像生成实验

FaceStudio 生成的多风格人像样例。
总结
综上所述,FaceStudio 的出现标志着个性化图像生成领域的重大进展。它在保持人物身份的同时,提供了丰富的风格化和文本驱动的图像生成选项。这种能力不仅对艺术创作和娱乐产业有巨大价值,也可能在广告、数字媒体制作和个性化内容创作等领域发挥重要作用。通过精确控制图像中的身份和风格,FaceStudio 为未来图像生成技术的发展开辟了新的道路,预示着这一领域的创新和变革。

破亿就破亿呗,跟你们腾讯那个破FaceStudio有啥关系?硬蹭热度也是没谁了。还"多张差异较大的照片"、"等待较长时间",自己都知道体验烂成狗,好意思吹?AI换脸把人整得亲妈都认不出,这玩意儿除了做表情包还有屁用。
卧槽这标题起的,我第一眼看过去还以为是R星跟腾讯搞了什么联动,结果点进来发现是硬蹭。GTA6预告片破亿确实牛逼,但你非要把AI三巨头塞进去说成啥“匪帮”,这就有点强行整活了。Hinton那老头子一把年纪了还戴大金链子?Yann LeCun那大胡子再配个墨镜,怎么看都像刚抢完网吧的落魄程序员,Bengio那一张学术脸就更离谱,黑帮老大开会都比他有杀气。真服了,这合成图看乐子还行,你说这是“技术突破”我是真忍不住想笑两声。 说实话GTA6预告片我刷了十几遍,画面细节确实绝了,迈阿密那种粉紫日落,街道上行人一个个跟真的一样,连沙滩上的水花都看着上头。然后看到下面那张所谓腾讯FaceStudio合成的“AI三巨头合照”,第一反应是:哦,这不就是换脸吗?现在随便一个手机APP也能搞这个,你告诉我这叫“新一代突破”?算了,你们做AI的反正天天突破,年年颠覆,我都听腻了。 不过既然是技术文章,我也认真看了几段。什么混合引导啊、身份识别模块啊、CLIP视觉编码器啊……一大堆名词堆上去,看得我头晕。但说人话不就是要你上传一张正脸照,再给他一张参考风格图,然后模型把你的脸贴在某个身体上吗?这玩意儿跟妙鸭相机有啥本质区别?就因为我多上传了一张照片,就算飞跃了?扯淡呢吧。 妙鸭相机我倒是真用过,那时候朋友圈一堆人发那个古装写真,我也跟风试了一把。要传二十多张照片,我当时还专门找角度拍,折腾了半小时传上去,它跟我说排队等一小时。行,我等。结果生成出来的玩意儿,我跟你说,我妈看了都摇头,说这哪个野男人?五官是有点像的,但整体气质约等于零,脸像被人揍肿了似的。我还试了那个什么“数字分身”功能,出来直接变硅胶娃娃,绝了。就这水平还号称什么爆款,大概是我长得不配吧。 回到FaceStudio,文章里吹的那个“多身份交叉注意机制”,说处理多人照片能分清谁是谁。我跟你说,我做视频剪辑的,经常拿AI合成演员的脸替换,这种多人场景我见得多了。你看着论文里那几个例子挺惊讶,实际用起来根本不行。只要两个人脸型稍微像点,或者有个侧脸、遮挡,它直接给你串脸。左边左边搞混,右边右边认错。真到那种三个人以上同框的场景,基本就是碰运气。腾讯这个我不敢说一定差,但你看他论文里放出来的图,三个人都正脸、打光还贼好,这能代表真实水平?我强烈怀疑是挑了上百张里最好的一张。 再说他那个“身份识别模块”用Arcface,这玩意儿我们搞安防都知道,平时拿来做人脸验证的,跟生成图像是两码事。你拿一个判别模型的特征硬塞给生成模型,物理上就不太对口。文章说通过线性层融合特征就搞定了,我听着怎么跟过家家似的。反正写论文嘛,都是自己设定问题自己解决,最后发个arxiv,又没人复现得了。你让腾讯把所有代码开源出来,我当场服气。 最让我不爽的是,这种AI写真技术现在已经被玩坏了。刷短视频经常看到有人拿AI换脸做明星擦边视频,还有诈骗团伙专门拿这个冒充熟人骗钱,前阵子不是有个新闻嘛,一个女的被AI换脸视频骗走了几十万。现在腾讯又说这个FaceStudio能做到“高辨识度”,那不是更给骗子递刀?你想想,以后打个视频电话,那边脸是你朋友,声音也是你朋友,其实是AI合成的,你信不信?我都觉得恐怖。技术是好技术,但你得管控啊,现在论文一挂、主页一放,代码随便下载,等于把高危武器扔给大街,你们腾讯负责吗? 而且,腾讯说“更注重保留人像的身份信息”,这话听着挺好,但仔细一琢磨就变味了。要是我随便拿一张你的照片,配上个暴力或者色情的风格,然后生成一个“你”干坏事,你说你是不是百口莫辩?尤其现在很多人社交平台上都公开自拍,拿一张正脸照太容易了。文章里还说什么“在不牺牲个人身份特征的情况下”,我看到这句话直接笑了,这不就是要把人搞得一眼能认出来吗?那万一用来作恶,受害者连辩解的机会都没有。技术无罪这话骗鬼呢,卖刀的难道不管刀砍人? 还有,腾讯这研究说白了就是站在StableDiffusion肩膀上。StableDiffusion是开源的,全世界不知道多少人拿它做工作,腾讯倒好,套了层壳,改个名,加上一个什么混合引导,就发论文吹成自家突破。你要真有本事,你就从零开始搞个生成模型出来,别天天对着开源代码修修补补,然后鼓吹“创新”。开源社区辛辛苦苦喂数据、写代码,你们拿去发论文评绩效,连致敬都不写一句。真不要个脸了。 再扯回GTA6。R星做游戏那是什么态度?开发了十多年,预告片里每一个镜头都是实打实的调校过的,人物表情、物理碰撞,全是硬功夫。反观AI写真行业,妙鸭火了没几天,一堆公司开始蹭,腾讯也急急忙忙出FaceStudio,就是为了证明“我也有”。可你做完之后呢?有多少人真的用?有多少场景能落地?我看大多数就是拿几张明星图搞噱头,要么就是卖会员割韭菜。文章里也承认“用户需要上传多张差异较大的照片,并且需要等待较长时间”,但妙鸭那会儿可是把用户坑惨了,高峰期排队两三个小时,我都以为自己在抢小米手机。 说真的,AI写真这条路现在就像当初的元宇宙,人人都喊风口,其实一窝蜂上去没几个会走的。腾讯这个FaceStudio就算技术强一点,又能怎么样?做出来了收费19块9生成一套图,新鲜劲过了吃灰。你说要跟GTA6比?笑死,游戏里随便一个NPC的路人建模都比AI生成出来的真实感强多了。GTA6整个城市的生态系统,每个人都有自己的行为模式,那才叫技术。而你FaceStudio,无非就是让人过一把换装瘾,还经常换得鬼都不像。 不过我也不是说这东西毫无用处。毕竟对于普通人来说,能一键把自己的照片变成动漫风、像素风、或者GTA风格,确实挺好玩。我自己之前拿AI把自己的毕业照改成赛博朋克的感觉,发朋友圈点赞还挺多。但好玩归好玩,别吹成什么“人工智能领域的里程碑”。这篇文章的字里行间都透着一股营销味,先蹭GTA6的热度,再吹腾讯的成果,最后还附上论文链接,你们说是吧?反正我看了就一个感受:腾讯给PR部门加鸡腿了,这文案写得比产品实在。 最后我还真想问一句,Yann LeCun、Hinton、Bengio这三位,你们知道自己的脸被腾讯拿去生成这种图了吗?人家好歹是图灵奖得主,每天研究的是怎么让AI更聪明更可靠,结果被网友拿去当黑帮玩,估计心里都要骂娘。LeCun那个暴脾气,之前还经常跟人吵架推特对线,看到自己被P成匪帮,搞不好发一条diss腾讯的推特呢。反正我没见过哪个正经科研大佬喜欢自己被搞成这种娱乐素材的,除非给了钱。 行了不说了,再说下去好像我多恨腾讯似的。其实我就是觉得,AI写真这东西现在吹得天花乱坠,实际体验谁用谁知道。文章里说的那些技术细节,放在论文里看着挺像那么回事,可用户拿到手还是那个尿性:上传一堆照片、等半天、生成结果一塌糊涂。FaceStudio叫什么“保留身份信息”,我寻思这也不是什么新概念啊,之前那种深度学习的换脸算法不也能保留吗?无非就是精度高一点点,你就能吹成“突破”了?中文科技圈的毛病,两米深的坑愣说成万丈深渊。 GTA6我还是会预购的,那个预告片确实吹爆,但那是因为R星用十年时间打磨的。至于腾讯的AI写真,我可不想等它十年打磨,我宁愿用美图秀秀手动P,至少不用排队。
@岛屿393
哈哈你这吐槽也太到位了 那张图我盯着看了半天 山姆奥特曼穿花衬衫活像个卖假表的 黄仁勋皮衣墨镜倒是没违和感 但站那儿跟要收保护费似的 说技术突破确实扯淡 不过话说回来 这三老头要是真进洛圣都 估摸着连脱衣舞俱乐部都找不到 全搁那儿研究怎么用AI预测警察巡逻路线呢 你刷十几遍预告片也挺狠 我看了三遍就开始琢磨这游戏得卖多少钱了🤣
绝了,技术是牛逼,但老惦记把真人脸往游戏里塞啥意思?GTA本来就是虚构的,搞这么真只会让骗子多素材,真服了。
这文章我翻了下,怎么说呢,感觉有点不太对味。倒不是说内容不对,是那个味儿不对。就是那种……你懂吧,一个游戏预告片火出圈了,然后公众号赶紧写一篇“AI也能凑热闹”的稿子,把两个不相干的东西硬绑一块儿。GTA6破纪录是真事儿,视频我也看了,说实话做得是挺带劲的,迈阿密那个阳光沙滩粉紫晚霞,一股子赛博味儿的老佛罗里达feel,确实是那味儿。但这跟腾讯那个FaceStudio有啥关系?就因为你们把几个AI大佬的脸P进了一张GTA风格的海报里?这逻辑就跟你在大街上看到一辆法拉利,然后拉住旁边卖煎饼的说“哎你这煎饼摊也能上F1赛道了”一样的离谱。硬蹭,真的硬蹭。 再说那个FaceStudio本身。文章里把这个玩意儿吹得跟花儿一样,什么“混合引导设计”,什么“多身份交叉注意机制”,什么“保留人像的身份信息”……这些词堆一块儿,我看得脑壳疼。你们知道老百姓看到这些词啥感受吗?就是那种……看天书的感觉。而且说实话,我仔细看了那几张所谓“AI三巨头当匪帮”的图,我就想问一句:这玩意儿真有文章里吹的那么神吗?那三个人物的脸确实能认出来是LeCun、Hinton和Bengio,但那个“神韵”吧,总觉得差了点啥。怎么说呢,就是那种……看着像,但也仅仅是像。五官是摆对了位置,但眼神里的那种神采,那种个人特有的精气神,没有。LeCun本人那张脸上总是挂着那种有点狡黠、有点欠揍的笑,你看他搞深度学习那几十年,照片上都是那种“老子天下第一”的劲儿。但合成图里他就是个板板正正的模型脸,跟个蜡像似的。Hinton那种老派英国绅士的严谨也和图里那个大头照对不上。 你们可能没试过那些AI写真App,我是真试过。去年妙鸭相机刚火那阵子,我女朋友拉我一起玩,上传了二十多张各种角度、各种表情、各种底妆光线的照片。好家伙,那叫一个严格。要求你照片不能戴眼镜,不能有刘海遮眉毛,不能笑得太夸张,不能背光……我寻思着拍个证件照都没这么麻烦。传上去之后,排队排了俩小时,最后生成出来的成品,怎么说呢,不能说一模一样吧,只能说是毫无关系。我男朋友看了我那组古风写真,笑得差点背过气去,说我像个抠脚大汉穿了花裙子,还是那种花钱买来的山寨货。我那几个同事也试了,出来的图十个有八个跟本人差了十万八千里。有一个还特别离谱,同事是个单眼皮,硬生生被整成了欧式大双,她说看着自己那样子晚上睡觉都能吓醒。所以我对这类产品一直是有疑虑的,文章里说妙鸭火了几周,确实,这种热度是一阵风的,新鲜劲儿一过,大家发现拿它P出来的图既不像自己也没啥大用,就把它卸了。 FaceStudio我看了一下,论文我读不大懂,什么CLIP视觉编码器、什么Arcface模型,对我来说就是火星文。但里面的那个设计思路,大体我是能猜出来的。说白了不就是一个大模型做底子,然后拿你的照片去里头“定向召唤”一个长得像你的人出来么。那个底子用的是开源的Stable Diffusion,算法是人家国外搞出来的,腾讯做的只不过是在上面加了个“人脸信息校准”的模块,让出来的东西更像本人一点。然后文章就把它吹成“重大突破”了。这话说的,好像腾讯是从零开始造了个轮子似的,可实际上他们是拿了一个现成的轮子,给轮子上抹了点防滑胶,然后就宣布“我们发明了新型轮胎”。 我不是说这技术没用啊,说实在的,它确实有点用。比如你拍了一组照片,想要个漫画风、赛博朋克风、古风版本,这技术确实能比你手动PS来得快。再比如说做游戏、做动画的,想给背景角色快速生成一堆看起来不一样的NPC脸,这玩意儿也许能省点功夫。但这些用处,都是“也许”“可能”“大概”的阶段。离文章里说的那种“巨大的潜力和受欢迎程度”,我觉得还有不少距离。 再说了,文章通篇就只谈技术有多牛,张嘴就是“保留身份特征”,闭嘴就是“多身份交叉”,但对用户最关心的隐私问题只字不提。你要用这类产品,就得先把自己的脸交出去,对吧?那问题就来了,咱这脸部数据到底被存在哪儿了?服务器在哪个国家?数据会不会被拿去二次训练?会不会被卖给什么广告商、数据贩子?你要是个普通人,你的照片被偷了,顶多是拿你去注册个社交账号骗骗人。但要是有心人拿你的脸跟一些敏感题材合成呢?现在AI这么发达,做出来的东西你根本分辨不出真假。前几天我一个朋友就跟我说,他收到一条语音,是他同学的声音,说急用钱要借5000块钱,转过去之后才发现是骗子。那同学根本没找他借钱。你想想,连声音都能仿了,现在这个FaceStudio又在玩命地“保留身份特征”,这要不是安了好心,那后果有多可怕不用我说了吧? 而且我还想问一个更二愣子的问题。GTA6预告片都破亿了,说明这游戏有多火,这个不用我多说。但咱能不能别什么热点都往上蹭?“AI三巨头也能秒变GTA匪帮”这个标题,我看了第一反应就是:这三个老头儿知道自己的脸被P成劫匪样儿了吗?他们乐意吗?这些大科学家,搞了一辈子研究,图的是让AI更好为人类服务,结果一转眼就被拿来当作宣传自家滤镜的背景板。这事儿怎么看都有点……不尊重人。你把人家做研究的人的照片拿来P成通缉犯,觉得这叫“酷”,我倒觉得这叫没分寸。你想想,要是别人把你的照片P成个抢劫犯挂网上,还配一行字儿说“看看,你这人也能当劫匪”,你心里什么滋味儿?就算他们不在美国待着,人家也不会乐意看到自己被这样玩。 还有个问题,文章整篇都充满了那种“AI要占领世界”的既视感。什么“人工智能技术迅速发展的今天”,什么“AI+图像应用领域”,这些话我已经听了八百遍了。每次都是“重大突破”,每次都是“颠覆性创新”,结果隔俩月你看那个东西还在不在?还在的话,又有多少人真的在用?妙鸭相机现在还有人提起吗?我看早凉了吧。这类产品说白了就是个玩具,用来娱乐还行,但要真说它是什么“技术发展方向”,那是上纲上线了。就像当年那个“一键飞起”的软件,以及各种换脸App,一个比一个火,一个比一个短命。 这些年我算是看明白了,很多公众号就喜欢把一件小事情往大了吹。那个FaceStudio,放在学术界,可能就是一个方向还走得通的研究,放老百姓手里,就只是一个功能又多了点儿的滤镜罢了。可文章的笔法,却把它写成了“AI界的一次革命”。你让游戏玩家怎么想?他们点开GTA6预告片,是想看R星怎么造出个更庞大的世界体系,是想看到车辆碰撞物理效果、NPC的AI行为逻辑更进一步,结果你告诉他们“AI三巨头也能变成游戏角色”?这不是废话嘛,你随便找个做动画的人,用Blender花几天功夫也能把这三位的脸捏出来塞进游戏里。问题在于谁会想要在游戏里用真实科学家当角色?这根本不是同一个赛道上的事。 再说回那张合成图本身,我专门去那篇文章里的主页瞅了一眼。看多了说实话我有点恍惚。这些个输出图片,好看吗?好看,是那种一眼看上去很光的网红脸风格。但你仔细看那条理感,还有皮肤纹理的微妙过渡,处理得很粗糙。人是很容易被那种“第一次看到精修图”的效果骗住的。多看几遍你就会发现里面的脸都带着一股“塑料感”。如果把图片放大看手指、看耳垂、看头发丝,破绽就出来了。跟那种手绘插画师一笔一笔画出来的线条质感完全不能比。所以我就不明白了,好多人说这东西要替代摄影师、替代画师,替代个锤子啊。至少现在,它顶多算是个高级一点的美图工具,离真正的设计审美还差得远呢。 文章里还提到FaceStudio在处理多人照片的时候表现优秀,说什么“准确地将不同身份的特征信息映射到图像的相应部分”。我就乐了,这玩意儿很难吗?PS里都能把两个人抠图出来再换脸,现在一个深度学习模型做这事儿也算创新?不是说不能算创新,而是你拿这个当卖点,是不是太看不起其他做图像处理的人了?大家都是用开源代码起家的,你加了个模块我也加了个模块,怎么就你成了“突破”了? 说到底,我最大的一个疑问是:这些东西真的能赚钱吗?做技术不能光拿来说梦,得吃饭啊。腾讯家大业大,养个团队搞一个论文,当然问题不大。但是普通用户会为这个付费吗?妙鸭相机起初搞了个9块9的付费服务,当时确实有不少人买单,可那是图新鲜。你见过有几个App能靠新鲜感活过一年的?用户新鲜感一过,就卸载了,留存率低得可怜。这种模式要想持续下去,得靠那些专业用户,比如广告公司、影视外包、电商商家,这些人可能愿意为了“批量生成模特图”付费。但前提是效果得真的够好才行。现在这效果,让他们用?我只能说,他们可能会直接开骂,因为他们不想要“好看但没用”的图,他们要的是高品质、有情绪、有故事感、能卖货的图。 反正我看完这篇文章的感觉就是:PPT做得好,不如产品做得好。GTA6那是花了多少年、烧了多少钱、打磨了多少细节才出来的东西,它的预告片能破纪录,是靠着品质实打实堆出来的。而AI写真呢?你把它放到明年再看,现在这些东西能留下什么?恐怕三年后回过头来大家连名字都记不住。 最后我还想说一句,文章结尾那个“论文地址”、“主页地址”这种操作,也不知道是给谁看的。普通网友不会点进去读论文,业内的人也不会因为一篇公众号文章就去读你的论文,他们直接去arxiv上翻了。这个“论文地址”放在这儿,与其说是给读者看的,不如说是给老板看的,证明“我们在做前沿研究”。你一个面向大众的AI产品的宣传稿,放个论文链接,好像突然就高大上起来了,实际上呢?读者看得一头雾水,专业的人觉得你多此一举。何必呢? 得嘞,就写这么多吧,一家之言,我不懂技术也不懂游戏,就是看这文章觉得哪儿哪儿都别扭。GTA6是好东西,AI也是好东西,但把这两个东西硬凑一起,还说什么“秒变”,这不胡闹么。
@疏影546
你别急,我先给你点个赞。你那个法拉利配煎饼摊的比喻我笑了半天,确实,这俩东西硬扯一块儿就跟拿肉夹馍蘸红酒似的,各有各的好,但凑一桌就是找别扭。但我也得替人家写稿的说句话,这年头编辑也不容易,辛辛苦苦憋一篇蹭热点的活儿,满脑子都是KPI,你让他老老实实只写GTA6他又写不过那些游戏大号,不蹭点AI的边儿拿什么混点击?其实现在的大环境就这样,什么火了都得硬贴一下,贴不上也得贴,贴完再说风马牛不相及就完事儿了,反正咱也不掏钱看。 不过咱说归说,我觉得GTA6那个预告片确实有味儿,迈阿密那个调调拿捏得死死的,阳光沙滩加点儿粉紫色的晚霞,一秒钟给我拉回当年玩那几代的晚上,萨诺那个满地图瞎跑的日子。但你要是说AI真能干出这画面,我打个问号,反正我自己拿那些个生成软件试过几次,出来的东西多半是看着像那么回事儿,走近了一看糊得跟没睡醒似的。至于FaceStudio,我就更没啥说的了,这玩意儿我头一回听说,跟GTA6扯上关系估计也就是那几个人的脸在效果图上能看个热闹,你说技术到底咋样,谁知道呢。反正文章我大概也扫了一眼,就跟我看到新闻标题直接划过去差不多,你要非说这俩有啥共同点,我看最多也就是都在屏幕前面冒个泡。