Replicate 發布第 12 期情報,重點介紹 FLUX.1 [dev] 的 LoRA 微調訓練功能正式上線,用戶能以極低成本訓練專屬圖像模型。同時,社群利用 Flux 生成的「帥氣祖克柏(Hot Zuck)」迷因引發熱潮,展現了極致的寫實度。此外,Replicate 作為開源 AI 部署首選平台,在知名播客 Lex Fridman 的節目中獲得高度關注。
Replicate 發布第 11 期技術週報,重點介紹開源影像生成模型 FLUX.1 的微調方法,讓開發者能以低成本訓練專屬風格。同時探討了「生成式電子遊戲」的最新進展,展示 AI 如何即時生成遊戲畫面與互動內容。最後,文章展望了生成式 AI 結合 3D 技術,為未來元宇宙與虛擬空間帶來的全新創作範式。
Replicate 宣布為熱門開源圖像生成模型 FLUX.1 推出微調(LoRA)支援。用戶現在可以透過 Replicate 的 API,僅需一行程式碼就能使用自己的圖片訓練專屬模型。這讓開發者與創作者能更輕易地在 FLUX.1 上實現特定人物、產品或藝術風格的客製化生成,大幅降低了商業應用的技術門檻。
由 Stable Diffusion 原班人馬創立的 Black Forest Labs 推出全新圖像生成模型家族 FLUX.1。該模型包含 Schnell、Dev 和 Pro 三個版本,在文字生成、複雜指令遵循以及人體細節上展現出驚人實力。Replicate 平台第一時間上架並進行深度實測,認為其美學風格與寫實度已能與 Midjourney v6 匹敵,為開源 AI 繪圖立下新標竿。
由 Stable Diffusion 核心團隊創立的 Black Forest Labs 發表了全新文字生成圖片模型 FLUX.1。該模型擁有 120 億參數,在文字渲染、細節描繪與指令遵循上皆超越現有開源模型。Replicate 已同步上架 FLUX.1 的 schnell、dev 與 pro 三種版本,開發者可直接透過 API 進行整合與部署。
Replicate 發布第 6 期技術情報,重點介紹 Google 全新開源的 Gemma 2 模型(包含 9B 與 27B 版本)已可在平台運行,其性能逼近更大參數的模型。同時,本期也更新了語言模型排行榜,並針對熱門的 Stable Diffusion 3 提供具體的提示詞與參數優化指南,幫助創作者解決人體畸變等常見生成問題。
Replicate 發布了簡易教學,指導使用者如何在本地 GPU 設備上透過 ComfyUI 運行最新發布的 Stable Diffusion 3 (SD3)。讀者只需在終端機複製並貼上幾行指令,即可快速完成環境部署,開始體驗 SD3 的本地圖像生成能力。這對於想要避開雲端限制、進行本地客製化創作的設計師與開發者非常實用。
Stability AI 的最新文字生成圖像模型 Stable Diffusion 3 已正式上架雲端託管平台 Replicate。此版本模型在圖像生成品質、文字排版精準度、複雜提示詞理解能力以及資源運行效率上,皆比前代有顯著的提升。開發者現在可以透過 Replicate 提供的雲端 API,僅需編寫一行程式碼,就能輕鬆將其整合至應用程式中。
Hugging Face 宣布與 Artificial Analysis 合作推出「文字生成圖片排行榜與競技場」(Text to Image Leaderboard & Arena)。該平台結合了類似 LMSYS 的人類盲測對決(Arena Elo 評分)以及客觀的效能指標(如生成速度與成本)。這為開發者與創作者提供了一個透明、標準化的基準,用以評估與比較市面上主流的開源與閉源圖像生成模型。
Vercel 舉辦年度 Ship 2024 大會,釋出多項重量級更新。其中 Next.js 15 RC 率先支援 React 19 與全新快取機制;Vercel AI SDK 3.1 大幅簡化了 AI 應用的開發流程,支援強大的 Tool Calling 與 Agents 架構;此外,全新升級的 Vercel Toolbar 與 Web 應用程式防火牆(WAF)也同步亮相,旨在為開發者提供更高效、安全且具備 AI 能力的現代 Web 開發平台。
Hugging Face 與 LCM 團隊合作推出 LCM-LoRA,這是一種通用的低秩自適應(LoRA)蒸餾技術。它能將 SDXL 等擴散模型的推理步數縮減至 4 步,同時保持極佳的影像品質。最重要的是,它能直接套用於現有的任何 SDXL 微調模型與 LoRA,無需重新訓練,為即時圖像生成帶來突破。
本文為 Replicate 釋出的技術教學,指導讀者如何在 Apple Silicon (M1/M2) Mac 上本地運行 Latent Consistency Model (LCM)。LCM 透過大幅減少去噪步數(僅需 1-4 步),將原本需要數十秒的 Stable Diffusion 圖片生成時間縮短至一秒以內,非常適合需要即時反饋的創作者與開發者。
Vercel 正式發表 AI 輔助 UI 生成工具「v0」。用戶只需輸入自然語言描述,v0 即可自動產生高品質的 React、Tailwind CSS 與 shadcn/ui 程式碼。該工具支援互動式微調與即時預覽,並能一鍵複製程式碼或部署,極大提升了前端開發與原型設計的效率。
Replicate 介紹了如何將熱門的 AI 動畫生成工具 AnimateDiff 與 ST-MFNet 幀插值(frame interpolation)技術結合。透過這種方法,使用者可以解決 AI 生成影片常見的抖動與卡頓問題,從文字提示詞直接產出高幀率、流暢且具備真實感的影片,大幅提升 AI 影片的視覺品質。
Hugging Face 釋出 3D Gaussian Splatting (3DGS) 的技術入門指南。3DGS 是 3D 重建領域的革命性技術,透過將稀疏點雲轉化為數百萬個 3D 高斯橢圓體,實現了超越 NeRF 的即時渲染速度(100+ FPS)與極短的訓練時間。本文詳細解析其運作原理,並介紹如何在 Hugging Face 平台上整合與展示 3DGS 成果。
本文回顧了文字生成圖像(Text-to-Image)技術的演進歷程。從早期的 GAN 限制,到 2021 年 VQGAN+CLIP 掀起的社群藝術熱潮,再到 2022 年 DALL-E 2 與 Stable Diffusion 的爆發。隨著 Stable Diffusion 迎來一週年及 SDXL 的推出,開源社群與微調技術正以前所未有的速度重塑視覺創作。
Hugging Face 發表了將 Stable Diffusion XL (SDXL) 部署於 Mac 的 Core ML 最佳化方案。透過先進的量化技術(如 6-bit 與 8-bit 量化),成功將龐大的 SDXL 模型體積縮減,使其能在 Apple Silicon(M1/M2 系列晶片)的 Mac 上流暢運行,顯著降低記憶體需求,並充分釋放 Apple 神經網路引擎(ANE)的硬體效能。
Vercel 深入探討了前端開發流程的演變,指出傳統「設計、交付、開發、部署」的線性流程正被快速的「設計到部署」迭代所取代。隨著 AI 技術與視覺化工具的興起,設計師與開發者之間的界線變得模糊,非技術人員也能更直接地參與產品的構建與發布。文章強調未來的「Builder」(建構者)將不再受限於傳統職能,而是能利用現代平台與 AI 協作,以極高的速度將創意轉化為線上運行的產品。
本文介紹如何使用 Hugging Face 專為 Unity 開發者設計的開源 API 套件,在遊戲中輕鬆整合 AI 語音辨識(ASR)功能。透過該套件,開發者可以直接調用 Hugging Face Inference API(如 OpenAI 的 Whisper 模型),將玩家的麥克風錄音即時轉換為文字。這為遊戲內語音指令、與 NPC 的語音對話等互動機制提供了極低門檻的實現路徑,且無需在本地運行龐大的深度學習模型。
本文為 Hugging Face 遊戲開發 AI 系列的第三篇,專注於「3D 資產生成」。文章探討了從傳統 3D 建模的痛點出發,介紹如何利用神經輻射場(NeRF)進行 3D 重建,以及使用 OpenAI Point-E、DreamFusion 等最新 AI 模型進行文字/圖像轉 3D。最後說明如何將這些 AI 生成的 3D 模型導入 Blender、Unity 或 Unreal Engine 等主流遊戲引擎,為獨立開發者與美術設計師提供全新的工作流。
本文是 Hugging Face 挑戰「5 天內用 AI 製作農場遊戲」的第二部分,重點在於 3D 資產的生成。作者探討了 2023 年初 3D AI 技術的現狀,實測利用 OpenAI 的 Point-E 進行文字生成 3D 點雲與網格,並嘗試用 Stable Diffusion 進行 3D 貼圖。雖然當時技術仍有網格混亂、缺乏 UV 貼圖等限制,但為獨立遊戲開發者展示了 AI 輔助 3D 工作流的雛形。
本教學為 Hugging Face 遊戲開發系列的第一部分,記錄了如何利用 AI 技術在 5 天內開發出一款農場模擬遊戲。文章重點介紹了開發初期的規劃、如何利用 Stable Diffusion 生成像素風(Pixel Art)美術資產,以及如何藉由 AI 輔助編寫 Unity 遊戲腳本,展示了 AI 如何大幅降低獨立遊戲開發的門檻。
Vercel 宣布推出「增強版預覽體驗」,將預覽部署轉化為即時協作空間。團隊成員可以直接在預覽網頁上進行標註、留下評論、擷取螢幕畫面,並自動同步至 GitHub、Jira 或 Slack 等工具,免去繁瑣的截圖與跨平台溝通流程,大幅縮短開發回饋循環。
本文介紹 Hugging Face 於 2022 年 11 月舉辦的「Diffusion Models Live Event」直播活動。該活動旨在向開發者與研究人員推廣擴散模型技術,並介紹當時新推出的 diffusers 函式庫。活動內容涵蓋從零開始訓練擴散模型、圖像生成原理及社群實作分享,是開源 AI 圖像生成發展史上的重要里程碑。
Replicate 宣布推出 DreamBooth API,大幅簡化了個人化圖像生成模型的訓練流程。開發者只需提供少數幾張特定主體的照片,並透過單次 API 呼叫,就能在雲端自動完成微調。訓練完成的模型會直接託管於 Replicate,並立即提供 API 端點供後續的圖像生成預測使用。
Replicate 平台讓開發者能夠透過簡單的 API 呼叫來運行 Stable Diffusion 等開源 AI 模型。 開發者無需自行架設昂貴且複雜的 GPU 基礎設施,只需使用 Python、JavaScript 等 SDK 即可快速整合。 此服務採用按秒計費制,非常適合用於黑客松、獨立開發專案或快速驗證產品原型。
本文探討基於文字生成向量草圖的 CLIPDraw 工具,並介紹「可微程式設計」概念。透過在優化過程中加入筆畫數量、顏色或幾何形狀等限制,創作者能引導 AI 擺脫雜亂線條,生成更具結構性與獨特藝術風格的向量作品,為生成藝術的微調與控制提供了清晰的實踐路徑。