Stream-Omni：同时支持各种模态组合交互,开启文本、视觉、语音结合

作者

2025-07-08

47次阅读

人工智能

中国科学院计算技术研究所自然语言处理团队推出了一款名为 Stream-Omni 的文本-视觉-语音多模态大模型。该模型基于 GPT-4o 架构，核心亮点是能够同时支持多种模态的灵活交互。