本期 AINews 聚焦於三家在 AI 開發者社群中聲譽極高的基礎設施新星:Exa(AI 專用搜尋引擎)、Modal(無伺服器 GPU 計算平台)與 TurboPuffer(高性價比無伺服器向量資料庫)。隨著新一輪融資,這三家公司正式邁入獨角獸或準獨角獸行列,展示了 AI 時代下,開發者對於高效能、低延遲且免維護的底層工具之強烈需求。這三家工具正重新定義現代 AI 應用的開發堆疊。
Hugging Face 推出全新「Ettin Reranker」重排模型家族,旨在解決 RAG 系統中檢索精度不足的痛點。該系列模型涵蓋多種參數大小,支援多語言與長文本處理,並與 Hugging Face 生態系深度整合。Ettin 透過創新的架構設計,在保持低延遲的同時,顯著提升了重排(Reranking)階段的 NDCG 指標,是開發者構建高效能 RAG 應用的全新開源選擇。
知名開源 OCR 工具 PaddleOCR 3.5 正式整合至 Hugging Face Transformers 生態系。開發者現在可以直接使用 PyTorch/Transformers 後端執行文字偵測、識別及表格解析等任務,無需安裝複雜的 PaddlePaddle 框架。這項更新極大地簡化了 OCR 與 RAG(檢索增強生成)等下游任務的整合流程。
IBM 發布全新開源多語言嵌入模型 Granite Embedding Multilingual R2。該模型採用寬鬆的 Apache 2.0 授權,支援高達 32K 的上下文長度。在參數小於 1 億(Sub-100M)的同量級模型中,它展現出最頂尖的資訊檢索品質,非常適合用於建構高效能且低資源消耗的 RAG(檢索增強生成)系統。
在一個相對平靜的新聞日,Latent Space 帶領讀者反思「微調(Fine-tuning)的終結」這一命題。 隨著長上下文視窗、高效 RAG 以及上下文內學習(In-context Learning)的成熟,許多原本需要微調的場景已被取代。 未來微調可能退化為僅用於調整輸出格式、風格或進行模型蒸餾的工具,而非首選的知識注入手段。
Hugging Face 發布最新指南,展示如何利用 Sentence Transformers 框架進行多模態嵌入與 Reranker 模型的訓練與微調。此更新簡化了將文字與影像對齊至同一向量空間的流程,並支援雙塔(Bi-Encoder)與交叉編碼器(Cross-Encoder)架構。這對於建構多模態 RAG(檢索增強生成)系統與跨模態搜尋引擎的開發者來說,提供了極低門檻的實作路徑。
Hugging Face 宣布其熱門開源庫 Sentence Transformers 正式支援多模態(Multimodal)嵌入與重排(Reranker)模型。開發者現在可以使用統一的 API 同時處理文本與影像,將它們映射到相同的向量空間中。這項更新大幅降低了建構多模態 RAG、圖文搜尋與跨模態推薦系統的門檻。
本指南展示如何利用 Hugging Face 的 sentence-transformers 庫與 NVIDIA 的 GPU 加速技術,在一天內構建專屬領域的向量嵌入(Embedding)模型。內容涵蓋利用 LLM 生成合成數據、選擇基底模型、使用對比學習(Contrastive Learning)進行微調,以及如何評估與部署。這套流程能有效解決通用模型在特定專業領域(如醫療、法律、金融)檢索率不佳的問題,是優化 RAG 系統的關鍵步驟。
Vercel 發布最新技術指南,探討如何不使用傳統的向量嵌入(Embeddings)與向量資料庫來構建知識型 AI Agent。隨著大語言模型(LLM)的上下文視窗大幅擴大,以及 Tool Calling(工具調用)技術的成熟,開發者可以直接利用長上下文、傳統全文檢索(如 BM25)或動態 API 查詢來實現精準的知識檢索。這不僅能大幅簡化系統架構,還能顯著降低維護向量資料庫的成本與開發門檻。
醫療 AI 平台 OpenEvidence 分享了他們如何贏得醫生信任的關鍵。透過與 Vercel 合作,他們構建了一個結合 RAG(檢索增強生成)技術的決策支持系統,能針對醫學提問提供精確且附帶權威文獻引用的解答。Vercel 的高效能前端基礎設施與邊緣渲染技術,確保了醫生在臨床現場能以極低延遲獲取關鍵資訊,解決了醫療 AI 常見的幻覺與速度痛點。
Vercel 宣布其 AI Gateway 正式支援 Parallel 的 Web Search 及相關工具。這項整合讓開發者在使用 Vercel AI Gateway 時,能直接調用 Parallel 的高效網頁搜尋 API,為 LLM 應用與 AI Agent 提供即時的網路資訊檢索。透過統一的 Gateway 管理,開發者能更輕鬆地監控、優化並安全地部署具備聯網能力的 AI 服務。
在本期 Import AI 中,Jack Clark 探討了 AI Agent 的實用化轉折點,分享他如何將 Agent 融入日常工作流,指出 Agent 已從「玩具」走向「實用工具」。此外,本期也介紹了一項安全研究「毒泉(Poison Fountain)」,展示了攻擊者如何透過持續注入惡意數據,污染 AI 系統的長期記憶與檢索機制,對當前日益普及的 Agent 安全性敲響警鐘。
Vercel AI Gateway 新增對 Perplexity Web Search 的支援。開發者現在可以透過 Vercel 的 AI 閘道器,輕鬆呼叫 Perplexity 的即時網頁搜尋能力,並享有 AI Gateway 提供的快取、速率限制、監控與分析等功能。這將有助於降低搜尋 API 的調用成本,並提升 RAG 應用的開發效率。
Vercel 宣布其 AI Gateway 現在支援將 Perplexity Web Search 整合至任何模型中。開發者不再受限於特定模型,即可在 API 呼叫中無縫加入即時網頁搜尋結果作為上下文。這項更新大幅簡化了 RAG(檢索增強生成)與即時搜尋應用的實作流程,提升了應用的資訊時效性。
Vercel 宣布推出「Vercel Knowledge Base」功能,旨在簡化 RAG(檢索增強生成)應用的開發。開發者可以直接在 Vercel 平台上上傳或同步文件(如 Markdown、PDF 等),系統會自動處理分塊、向量化與儲存。這讓開發者無需自行架設與維護複雜的向量資料庫,即可快速為 AI 代理或聊天機器人提供精準的背景知識。
AI 搜尋引擎 Tavily 在 Hugging Face 部落格分享了其「Deep Research」技術的幕後架構。該系統旨在解決傳統單次搜尋無法應付複雜任務的痛點。透過結合多步驟代理人規劃、動態查詢擴展、內容去噪與重排技術,Tavily 成功在複雜研究任務中取得領先(SOTA)地位,並詳細解析了其評估方法與實作細節,為開發者提供建構自主研究代理人的實用指南。
Vercel 宣布在其官方文檔(Vercel Docs)中正式上線 AI Chat 聊天功能。開發者現在可以直接在文檔頁面與 AI 助手對話,快速獲取程式碼範例、排查部署錯誤並解答技術疑問。此更新旨在提升開發者的閱讀與檢索效率,減少在繁雜文檔中搜尋解答的時間。
廣受開發者歡迎的開源嵌入向量庫 Sentence Transformers 宣布正式加入 Hugging Face。未來該專案將移至 Hugging Face 的 GitHub 組織下管理,獲得更多官方資源支持。這項合作將深化其與 Hugging Face Hub 的整合,提升模型託管、文檔與效能優化,為 RAG 與語意搜尋應用提供更穩定的開源基石。
本文探討如何利用開源模型(如 Florence-2、Qwen2-VL 與 Llama-3.2-Vision)替代傳統 OCR 系統。開源 VLM 不僅能精準辨識文字,還能直接輸出 JSON 或 Markdown 等結構化格式,解決複雜排版與表格解析的痛點。透過 Hugging Face 生態系,開發者可以輕鬆部署並微調這些模型,打造高效、低成本且隱私安全的文檔處理 Pipeline。
Replicate 平台上架了來自 Datalab 的兩款全新文件解析模型:Marker 與 OCR。Marker 專為將整份複雜文件(如 PDF)轉換為乾淨的 Markdown 格式而設計,非常適合 RAG 應用;OCR 模型則能精確提取圖片或文件中的文字,並提供行級(line-level)的多邊形定位座標,為開發者提供高效的文件預處理方案。
Hugging Face 發表全新檢索評估標準 RTEB(Retrieval Evaluation Benchmark)。相較於專注向量表徵的 MTEB,RTEB 更著重於 RAG 實戰中的端到端檢索表現。它涵蓋了混合檢索、重排(Reranking)及多跳推理等複雜場景,並提供開源評估工具,幫助開發者與研究人員精準衡量檢索器在真實應用中的效能。
Hugging Face 與社群合作推出 mmBERT,這是基於 ModernBERT 架構的多語言版本。mmBERT 繼承了 ModernBERT 的現代化改進(如 FlashAttention、RoPE 與 8192 token 長文本支持),旨在取代傳統的 mBERT 與 XLM-RoBERTa。它能顯著提升多語言文本分類、命名實體識別(NER)及檢索(RAG)等任務的運算效率,為開發者提供更強大且省資源的開源選擇。
Google 正式推出全新開源嵌入模型 EmbeddingGemma。該模型基於強大的 Gemma 2 架構,專為檢索、語意搜尋與 RAG(檢索增強生成)等任務設計。EmbeddingGemma 在 MTEB 等主流基準測試中表現優異,並提供高效的推理能力。目前已全面整合至 Hugging Face 生態系統,開發者可透過 transformers 與 sentence-transformers 輕鬆部署與微調。
Hugging Face 發表最新指南,展示如何利用 Model Context Protocol (MCP) 將 AI 模型與學術研究工具無縫串接。文章介紹了如何建立 MCP 伺服器來連接 arXiv、Semantic Scholar 及 Zotero 等文獻資料庫,讓 AI 能夠直接檢索、閱讀並整理最新學術論文。這項技術不僅能大幅降低 AI 的幻覺,還能自動化文獻回顧與資料分析流程,是科研人員與開發者構建智慧學術助理的實用指南。
Hugging Face 探討將「內容定義分塊 (CDC)」技術引入 Parquet 檔案格式。傳統固定大小分塊在資料微調時會導致快取失效,而 CDC 透過動態錨點切分,能精準識別重複內容。此技術將大幅優化大規模 AI 訓練資料集的去重效率、降低增量下載的頻寬消耗,並為 RAG 檢索提供更穩定的分塊基礎。
Hugging Face 發表全新的 Ettin Suite,這是一系列最先進(SoTA)的成對編碼器與解碼器(Paired Encoders and Decoders)模型。該套件旨在解決傳統雙向與單向模型在表徵學習與序列生成之間的斷層,提供更緊密的語意對齊。Ettin 在多項檢索(RAG)與生成基準測試中表現優異,並完全開源供社群使用。
Hugging Face 釋出最新指南,介紹如何利用 Sentence Transformers 庫訓練與微調稀疏嵌入(Sparse Embedding)模型。稀疏嵌入(如 SPLADE)能將文本轉化為高維稀疏向量,在保留關鍵字匹配能力的同時具備語意理解力。此更新簡化了訓練流程,讓開發者能輕鬆構建適用於混合檢索(Hybrid Search)的高效檢索系統。
Hugging Face 宣布與 Cohere 合作,將其納入「推論提供商(Inference Providers)」生態系。現在開發者可以直接在 Hugging Face Hub 上,透過 Cohere 的託管服務免伺服器(Serverless)調用 Command R 和 Command R+ 等熱門模型。這項整合簡化了開發流程,讓用戶無需自行部署即可在 HF 生態系中無縫測試與整合 Cohere 的強大語言模型。
Hugging Face 介紹了由普林斯頓大學等機構提出的 HELMET 基準測試,旨在解決現有長文本評估(如 Needle In A Haystack)過於單一的問題。HELMET 包含 7 大類、11 個真實應用數據集,涵蓋長文本問答、摘要、資訊檢索與程式碼生成等。測試結果顯示,許多宣稱擁有超長上下文的模型,在實際複雜任務中的有效性能會隨著長度增加而顯著衰退。
Hugging Face 釋出全新教學,詳細介紹如何利用 Sentence Transformers 庫訓練與微調 Reranker(重排)模型。Reranker 在 RAG 系統中扮演關鍵角色,能對初步檢索的文檔進行二次精準排序。本文涵蓋資料準備、損失函數選擇、訓練流程及評估方法,幫助開發者針對特定領域優化檢索效果。