Hugging Face 發表了 SmolVLM 家族的最新成員:256M 和 500M 參數的超小型視覺語言模型(VLM)。這兩款模型體積極小,旨在讓多模態 AI 能在手機、物聯網設備或瀏覽器中流暢運行。儘管尺寸迷你,它們在基礎圖像描述與問答任務上仍展現出實用的性能,為邊緣端多模態應用開闢新路徑。
阿布達比技術創新研究所(TII)正式發布 Falcon 3 系列開源模型,提供 1B、3B、7B 及 10B MoE 等多種參數規格。Falcon 3 在多項基準測試中表現優異,其 7B 版本在性能上甚至超越了 Llama 3.1 8B 與 Gemma 2 9B。此系列模型對硬體友善,極適合邊緣運算與本地部署,並已深度整合至 Hugging Face 生態系統。
Hugging Face 發表全新輕量級視覺語言模型 SmolVLM(約 2.2B 參數),專為本機與邊緣設備設計。該模型結合了 SigLIP 視覺編碼器與 SmolLM2 語言模型,不僅支援多圖輸入與影片分析,在多項基準測試中更展現出媲美更大尺寸模型的性能。SmolVLM 採 Apache 2.0 開源授權,極低記憶體佔用使其成為開發者在終端裝置部署 VLM 的理想選擇。
Hugging Face 與 Keras 團隊宣布 Llama 3.2 模型正式登陸 Keras 生態系。開發者現在可以透過 KerasNLP 輕鬆載入 Llama 3.2 的 1B 與 3B 輕量級模型。得益於 Keras 3 的多後端架構,使用者能自由切換 JAX、PyTorch 或 TensorFlow,並利用 LoRA 等技術進行高效微調與跨平台部署。
Meta 正式發布 Llama 3.2,最大亮點為首次推出 11B 和 90B 的視覺多模態模型,能理解圖像與圖表;同時推出專為手機與邊緣裝置設計的 1B 和 3B 超輕量文字模型,支援 128k 脈絡長度。Hugging Face 已在 Transformers、TGI 及微調工具中全面支援,方便開發者即刻部署與應用。
本文介紹 Hugging Face 與 Intel 合作的最新部署方案。透過 optimum-intel 工具,開發者可以輕鬆將 Transformers 模型轉換並量化(如 INT4)為 OpenVINO 格式。接著,利用全新且輕量化的 openvino-genai API,即可在 Intel CPU、GPU 及 NPU 上實現極速的生成式 AI 推理,大幅簡化了從模型訓練到邊緣端部署的流程。
Hugging Face 釋出最新指南,介紹如何將現有的預訓練大語言模型(LLM)微調至 1.58-bit(三進制模型)。傳統的 BitNet 1.58B 需要極為昂貴的從頭預訓練,而此方法允許開發者直接對現有開源模型(如 Llama)進行極限非線性量化微調。這項技術將權重限制在 -1、0、1 三個值,極大降低了顯存佔用與計算頻寬,讓大模型在消費級硬體甚至 CPU 上也能高效運行。
Google 宣布推出 Gemma 家族新成員:僅有 2.6B 參數但性能強悍的 Gemma 2 2B 輕量模型;專為過濾有害內容設計的安全分類器 ShieldGemma(提供 2B、9B、27B 版本);以及包含逾 400 個稀疏自編碼器的 Gemma Scope,為 AI 領域提供前所未有的模型內部決策「可解釋性」研究工具。
AMD 與 Hugging Face 合作舉辦「Pervasive AI 開發者大賽」,旨在推廣 AMD 的 AI 硬體生態系。競賽分為生成式 AI、機器人 AI 與 PC AI 三大賽道,參賽者需利用 AMD Radeon GPU、Ryzen AI 或 Kria 開發套件,並結合 Hugging Face 的模型進行開發。本活動提供豐富的硬體支援與高達 15 萬美元的總獎金,吸引全球開發者共襄盛舉。
本指南為開發者與 AI 愛好者提供在各種平台上本地運行 Llama 2 的實用方法。內容涵蓋適合 Mac 用戶的 Ollama、跨平台的 llama.cpp、圖形介面的 LM Studio,以及能在手機上運行 Llama 2 的 MLC LLM。透過這些工具,使用者無需依賴雲端 API 即可保護隱私並降低成本。