近日,豆包实时语音大模型正式上线,并已在豆包APP全面开放使用。该模型不仅能实时联网获取最新信息,还具备理解用户情绪、精准控制语气语调的能力,可实现拟人化的情绪承接和丰富的情感表达,支持讲故事、方言、唱歌等多样化语音表现,且延迟极低,可以随时被用户打断,带来丝滑流畅的交互体验。 在对比测试中,豆包模型整体满意度远超GPT-4o,特别是在语音自然度和情感丰富度上表现突出。多个维度测评显示,豆包语音大模型得分高达4.36分,远高于GPT-4o的3.18分,超过半数测试者给予满分评价,且在辨别是否为AI方面被认为极少像机器声,这展现出该模型极强的拟人交互优势。 未来,情感丰富的语音交互将广泛推动AI在软硬件领域的发展。情感陪伴和智能教育、AI玩具与宠物硬件、以及AI眼镜、耳机、音箱等智能生活产品都将显著受益,提升用户体验和产品竞争力。市场风险在于AI应用推广进度和商业化效果不及预期,相关企业经营存在一定压力。