对话生数科技CEO唐家渝:AI视频到了“普及”节点 提升时长不是产品化的重点
9月11日,生数科技举办媒体开放日活动,发布“主体参照”(Subject Consistency)功能,意在破解视频模型生成主体的“一致性”难题。
活动上,生数科技联合创始人、CEO唐家渝在回应《每日经济新闻》记者关于商业模式的提问时表示,目前行业内有SaaS(软件即服务)订阅和MaaS(模型即服务)两种,7月30日Vidu上线以来,在全球范围内已收到数万个API接入申请。
就底层架构,唐家渝表示旗下产品“VIDU”所用的“U-ViT架构”与Sora所用的“DiT架构”几乎一模一样,差别在于U-ViT作了更多面向落地的设计。在技术路线上,大家现在处于底层架构收敛的状态,但同质化并不代表大家所有进展、能力相同,唐家渝举例说:“例如现在的语言模型,(虽然)大家都使用Transformer架构,但从现实来看,OpenAI还是明显领先的。”
目前,AI视频的主要使用者还是专业用户,如电影工作者等,但唐家渝认为,AI视频已经来到了“普及”的节点。
此外,从当前阶段的收入来说,生数科技在B端市场获得的收入更多,C端的增长曲线则在Vidu产品上市这一个月以来非常“陡峭”。
唐家渝 图片来源:每经记者 李少婷 摄
“最终的目标还是做通用大模型”
唐家渝是清华大学自然语言处理实验室硕士,此前曾任瑞莱智慧副总裁、腾讯优图实验室高级产品经理等。唐家渝目前所在的生数科技于2023年3月成立,今年3月初宣布完成新一轮融资。今年4月底,该公司与清华大学联合研发的原创视频大模型Vidu面向全球发布,7月底正式上线,全面开放使用。
Vidu问世即被称为“中国版Sora”。这种称呼一方面是因为外界对中国视频大模型充满期待,另一方面,从技术架构上说,二者也有异曲同工之处。
据介绍,Vidu的底层基于自研的U-ViT架构,而Sora是基于DiT架构。关于U-ViT与DiT架构的区别,唐家渝介绍:“一句话总结来说,几乎一模一样。”二者都是Diffusion和Transformer的融合,甚至底层一些技术细节也是相同的。不同之处在于,U-ViT架构“做了更多面向落地的优化设计”,简单概括下来,就是在训练同一模型时,相同时间下,U-ViT所需的算力更少。
从整体的技术路线来看,当前国内几家视频大模型都走的是“类Sora路线”,那大家未来是否会愈加同质化?
对此,唐家渝介绍,当前大家是处于底层架构收敛的状态中,“但同质化并不代表大家所有进展、能力都相同”。他以语言模型为例分析道,大家都会使用Transformer架构,但从现实情况来看,OpenAI还是明显领先,这是因为在这一架构基础上仍有诸多环节需要技术技巧、实践经验帮助破解难点,这就导致了不同语言模型在能力上的差距。
当前,业内也在探索新的架构路线,例如将多模态的生成和多模态理解结合起来,但目前仍没有特别好的方案出现。
“我们最终的目标还是做通用大模型,视频生成是多模态生成大模型中间的一个阶段。”唐家渝坦承了开发通用大模型的雄心。
他还表示:“这并不意味着我们完全只在做这一个事情(指视频大模型),我们除了视频以外也有其他模态的生成能力。”
成为付费用户可以阅读 生数科技 所有资料
了解更多 →