









DeepFloyd IF 是一個最先進的開源文本到影像模型,具備高程度的照片真實感和語言理解能力。它是一個模組化系統,由一個固定的文本編碼器和三個級聯的像素擴散模組組成:一個基礎模型根據文本提示生成 64x64 像素的影像,以及兩個超解析度模型,分別設計用來生成逐漸增大的解析度影像:256x256 像素和 1024x1024 像素。
使用 DeepFloyd IF 可以透過本地筆記本、與 Hugging Face Diffusers 整合,或在本地運行程式碼來實現。這涉及設置環境、安裝必要的函式庫,以及將模型載入 VRAM。

