本网站内容使用人工智能(AI)或机器翻译技术翻译,可能存在错误。

Skip to content

从文字到世界:利用大型语言模型代理将单行提示转化为多模态数字故事

View Publication

Author

李丹瑞(罗格斯大学)、塞缪尔·S·孙(罗格斯大学)、张森(罗格斯大学)、张哲瑞(罗格斯大学)、穆巴西尔·卡帕迪亚(Roblox)

Venue

ACM SIGGRAPH 2024 动态、交互与游戏会议

Abstract

数字叙事在娱乐、教育和营销领域至关重要,但在制作的可扩展性和灵活性方面面临挑战。本文介绍的StoryAgent框架利用大型语言模型和生成式工具,实现数字叙事的自动化和优化。 通过采用自上而下的故事构思与自下而上的素材生成方法,StoryAgent 解决了人工干预、交互场景编排及叙事连贯性等关键问题。该框架能够高效产出跨多模态的交互式连贯叙事,从而普及内容创作并提升用户参与度。我们的实验结果表明,该框架无需参考视频即可生成连贯的数字故事,标志着自动化数字叙事领域取得重大进展。