微軟發布 AI 圖像生成和文字轉語音工具 - MAI-Image-2.5-Pro、MAI-Voice-2-Flash


微軟發布兩款新 AI 模型 MAI-Image-2.5-Pro、MAI-Voice-2-Flash,針對圖像生成和文字轉語音工具,兩者皆在 Microsoft Foundry 中可用。

MAI-Image-2.5-Pro 是一款集文本到圖像生成和圖像到圖像編輯於一體的模型,旨在根據自然語言提示創建高品質、視覺效果豐富的圖像,並對現有圖像進行精確可控的編輯。它採用基於擴散的生成方法來逐步優化圖像,從而實現輸入文字與生成輸出之間的高度對齊。

主要用例

  • 文字轉圖像生成:根據自然語言提示產生高品質圖像,使用戶能夠將文字描述轉換為視覺上連貫的輸出,適用於各種創意和設計用例。
  • 影像到影像編輯:支援對現有影像進行精確、可控的編輯,包括物件移除、替換、屬性變更、影像修復、文字更新和瑕疵清理,同時保持構圖和佈局。
  • 照片級真實感影像合成:能夠產生具有一致視覺結構的逼真影像,使其適用於概念視覺化和內容創作場景。
  • 高保真肖像:生成富有表現力、外觀自然的肖像,具有準確的臉部結構、光線和紋理。
  • 產品、品牌和商業設計:非常適合產品圖像、行銷視覺效果、品牌資產和商業創意工作流程。
  • 精確的文字渲染:改進了生成的圖像(包括標籤、海報、包裝和標誌)中文字的渲染效果。
  • 視覺推理:能夠綜合考慮物體、場景結構、光照、比例和空間位置等因素,即使面對模糊的提示,也能產生一致的輸出。
  • 複雜場景中的物件一致性:在視覺密集的構圖中,物件保持相同的身份、材質、比例、標記和方向。
  • 角色在不同視角和場景下的一致性:無論姿勢、拍攝角度、表情、服裝和光照條件如何,人物或角色都能保持可辨識度。
  • 材料和物理性能精度
  • 材料的外觀和行為會根據其在現實世界中的屬性而有所不同,包括反射、半透明度、重量、紋理和變形。
  • 空間和幾何推理
  • 物體在三維空間中以連貫的方式定位,具有可信的比例、透視、遮蔽和結構關係。

MAI-Voice-2-Flash 是一款專為超快速、低延遲語音生成而打造的文字轉語音 (TTS) 模型。它支援 15 種語言,能夠提供高保真、自然且富有表現力的語音,並針對即時回應進行了最佳化。 Voice-2-Flash 保留了人聲的語調、節奏和情緒細微差別,使其成為語音助理、語音助理以及其他對速度要求極高的互動場景的理想之選。

主要用例

  • 虛擬助理和聊天機器人—利用自然語音,為應用程式和裝置上的對話代理提供支援。
  • 呼叫中心座席– 透過自然、富有表現力的語音輸出,支援即時座席工作流程。
  • 輔助功能– 為視障使用者提供旁白和輔助語音技術。
  • 教育體驗-透過生動的敘述建構互動式學習內容。
  • IVR系統-實現自然、富有表現力的呼叫中心互動。
  • 公共廣播-為公共資訊系統提供清晰、引人入勝的語音輸出。

https://ai.azure.com/catalog/models/MAI-Image-2.5-Pro

https://ai.azure.com/catalog/models/MAI-Voice-2-Flash

Picture Source

Microsoft

留言