OpenAI近日正式发布新一代多模态大模型GPT-4o。该模型的核心突破是实现了文本、音频和视觉的实时原生交互,语音响应延迟大幅降低,对话体验更接近真人。GPT-4o不仅能听懂语气,还能通过摄像头实时分析画面并给出反馈。目前,其文本和图像功能已向所有用户免费开放,语音功能正逐步推送。这意味着AI助手正从单一的文本工具,加速向全能型实时交互伙伴演进。

OpenAI近日正式发布新一代多模态大模型GPT-4o。该模型的核心突破是实现了文本、音频和视觉的实时原生交互,语音响应延迟大幅降低,对话体验更接近真人。GPT-4o不仅能听懂语气,还能通过摄像头实时分析画面并给出反馈。目前,其文本和图像功能已向所有用户免费开放,语音功能正逐步推送。这意味着AI助手正从单一的文本工具,加速向全能型实时交互伙伴演进。
