如何將 Hugging Face 中的 GGUF 模型匯入 Jan AI

最後更新: 2026年31月07日

  • Jan AI 讓您在本地運行 GGUF 語言模型,同時確保完全的資料隱私。
  • 該軟體提供多種導入方式,從其整合的 Hub 到上傳本機檔案或 Hugging Face 連結。
  • 該工具可自動偵測模型的元數據,從而更容易配置架構和聊天範本。
如何將 Hugging Face 中的 GGUF 模型匯入 Jan AI

如果你對人工智慧感興趣,但又不想將私人對話和文件發送到外部伺服器,Jan AI 提供了一個非常有趣的替代方案。它是一款免費開源的桌面助手,可以… 直接在電腦上運行語言模型.

它最大的優點之一是它與…的兼容性 使用 llama.cpp 的 GGUF 格式模型這樣一來,您就可以下載量化模型,利用電腦的 CPU 和顯示卡,即使沒有網路連線也可以使用它們。

實際上,你可以將 Jan 變成一個私密且可自訂的 ChatGPT 工具。但是,隱私取決於你的設定。 本地模型處理設備上的數據同時,與 OpenAI、Anthropic 或其他外部提供者的連線會向其伺服器發送請求。

如何在 Jan AI 中下載並運行模型
相關文章:
如何在 Jan AI 中下載並運行模型

導入 GGUF 模型之前需要準備什麼

導入 GGUF 模型之前需要準備什麼

在下載找到的第一個模型之前,最好先檢查該檔案是否與 llama.cpp 相容,以及其大小是否在可用記憶體範圍內。 Hugging Face 模型庫通常包含相同型號的多個量化版本,例如 Q4_K_M、Q5_K_M 或 Q8_0。

量化可以減少資料負載量,使大型模型能夠在效能較低的機器上運作。一般來說, Q4_K_M 在品質、記憶體佔用和速度之間取得了良好的平衡。Q5_K_M 和 Q8_0 保留了更高的精度,但代價是佔用更多空間,需要更多 RAM 或 VRAM。

您還應該檢查模型架構。雖然 llama.cpp 支援大量模型族,但新發布的模型可能需要更新版本的引擎。如果檔案無法載入,並不一定表示檔案已損壞。 1 月安裝的後端可能還無法辨識其架構。.

從 Jan's Hub 下載模型

添加模型的最簡單方法是使用 Jan的綜合中心在本部分,您可以搜尋模型,查看可用版本,並下載最適合您電腦的量化版本。

下載開始後,Jan 會在頂部指示器上顯示模型和完成百分比。您可以取消下載,如果發生錯誤,只需再次按下下載按鈕即可重試。

獨家內容 - 點擊這裡  如何啟動HP Elitebook?

這種方法特別推薦給初學者,因為 Jan 會負責… 儲存檔案並準備必要的配置下載完成後,模板將出現在聊天選擇器中,您可以載入它並開始使用。

使用其 ID 導入 Hugging Face 模型

使用其 ID 導入 Hugging Face 模型

Hub 還允許您使用模型庫標識符來尋找 Hugging Face 上可用的模型。為此,請複製格式為 的 ID。 organizacion/nombre-del-modelo 然後將其貼到 Jan's Hub 的搜尋欄中。

例如,您可以尋找類似這樣的儲存庫。 bartowski/Qwen2.5-7B-Instruct-GGUF如果 Jan 識別出儲存庫,它將顯示可用的量化版本,以便您可以選擇並下載其中一個。

在繼續之前,請確保存儲庫包含文件。 GGUF 與 llama.cpp 相容如果儲存庫僅包含 Safetensors 等格式的權重,則無法以這種方式將其載入為本機模型。

Hugging Face的部分模特兒有使用限制,需要您事先接受其使用條款。在這種情況下,您需要登入Hugging Face,取得存取令牌,並將其輸入到[相應的欄位/程式/等等]。 設定 > 常規 > 其他 > HuggingFace Token具體位置可能因 1 月的版本而略有不同。

您也可以在 Hugging Face 上開啟相容型號的頁面,點擊 使用此模型 然後在本機應用程式部分選擇 Jan。瀏覽器將嘗試開啟 Jan 以開始匯入。

Jan AI
相關文章:
如何在 Jan AI 中啟用 GPU

如何匯入儲存在電腦上的 GGUF 文件

如果您已經使用瀏覽器或其他工具下載了該文件,則無需再次從 Hub 下載。一月份,請前往 設定 > 模型提供者開啟 llama.cpp 設定檔並按下該選項 進口.

接下來,選擇儲存在您電腦上的 GGUF 檔案。 Jan 將分析其元數據,以識別諸如架構、分詞器以及(如果可用)對話模板等資訊。

Jan 可以從模型目前位置連結該模型,而無需建立另一個完整的副本。這節省了空間,但也意味著 您不得移動、重新命名或刪除原始文件 導入之後,如果這樣做,Jan 可能會丟失引用並停止載入模型。

安裝完成後,打開一個新的聊天窗口,選擇模板,然後等待載入完成。首次載入可能需要更長時間,尤其是在檔案較大或主要佔用 CPU 資源的情況下。

獨家內容 - 點擊這裡  如何手動安裝USB驅動器?

將使用 Ertas Studio 調整後的模型匯入 Jan。

執行操作的用戶 語言模型的微調 他們還可以使用 Jan 作為運行時環境。像 Ertas Studio 這樣的工具讓你在雲端訓練或微調模型,並將結果匯出為 GGUF 格式。

這並非兩個應用程式之間的直接整合。工作流程包括在 Ertas Studio 中準備和訓練模型、評估其結果、匯出量化版本,以及 稍後在1月加載GGUF文件。 使用本地導入選項。

導出前,建議測試不同的量化方式。 Q4_K_M 通常是一個不錯的選擇,適合在家用電腦上分發模型;而如果目標電腦記憶體充足,Q5_K_M 或 Q8_0 可以提供更高的保真度。

該系統允許開發針對特定文件、術語​​或任務量身定制的嚮導,並可在無需永久依賴 API 的情況下執行這些嚮導。然而,在醫療保健或金融等行業, 在當地開展工作本身並不能保證符合監管要求。此外,還需要控制資料來源、權限、儲存和裝置存取。

調整 Jan 的設置,使模型運行速度更快

模型的運行速度取決於模型大小、所選量化等級以及可用硬體。透過模型旁邊的設定圖標,您可以修改上下文、溫度以及發送到 GPU 的層等參數。

調整 GPU層 這決定了顯示卡處理的圖層數量。較高的值通常會顯著提高速度,但也會增加顯存消耗。如果模型無法載入或出現記憶體錯誤,請降低此值,直到找到穩定的設定。

上下文長度也會影響記憶體消耗。即使模型支援數萬個令牌,從一開始就配置最大值也能為鍵值快取預留大量記憶體。如果系統資源耗盡,請嘗試… 減少上下文或使用量化緩存.

在配備 NVIDIA 顯示卡的系統上,建議確認 Jan 使用的是相容的 CUDA 後端。在其他系統上,您可以根據硬體和作業系統選擇使用 Vulkan、Metal 或 CPU 的 CUDA 後端。 Jan AI 無法偵測到顯示卡更新驅動程式和 llama.cpp 引擎通常是首要步驟之一。

獨家內容 - 點擊這裡  如何在 Windows 10 中安裝記事本

如何刪除模板並恢復磁碟空間

GGUF 檔案可能佔用數 GB 的空間,因此很容易累積數十 GB 的不再使用的模型檔案。若要單獨刪除某個文件,請進入其設定並點擊垃圾桶圖示。

Jan 還允許您執行大量清理。前往 設定 > Llama.cpp —或在相容的蘋果設備上使用 MLX—並使用 全部刪除 在模型部分。確認之前,應用程式會顯示將釋放多少空間。

此功能會移除 Jan 管理的下載,但是 它能保持手動連結的本地模型完整無損。在這種情況下,應用程式引用會被移除,而不會刪除原始檔案。

如果 Jan 無法辨識或載入 GGUF 模型,該怎麼辦?

如果 Jan 無法辨識或載入 GGUF 模型,該怎麼辦?

當模型無限期載入失敗或 Jan 顯示錯誤時,它首先會檢查檔案是否已下載完成且未被分割成多個部分。一些大型模型會以多個 GGUF 檔案的形式分發,這些檔案必須保持原有名稱並位於同一資料夾中。

也可能是目前版本的 llama.cpp 與新發布的架構不相容。請前往引擎設置,安裝最新版本,並啟用自動更新(如果您希望接收新版本)。

如果問題與記憶力有關,請嘗試以下措施:

  • 減少發送到GPU的層數。
  • 減少上下文的最大長度。
  • 關閉佔用大量記憶體或顯存的遊戲和應用程式。
  • 使用較小的量化級別,例如 Q4_K_M。
  • 配置 Jan 一次只載入一個模型。
  • 嘗試使用與您的處理器或顯示卡相容的其他後端。

從其他資料夾匯入模型後,也要檢查檔案是否仍在原位置。如果檔案已被移動或重新命名,請刪除其對 Jan 的引用,然後重新匯入。

Jan 也接受客製化模型,例如 Jan-v3-4B它基於 Qwen3-4B-Instruct-2507,還可以連接到 OpenAI、Anthropic、OpenRouter 和其他相容服務。這種組合允許您在需要隱私時使用本地模型,並在需要更強大的功能或特定功能時使用外部提供者。

因此,將GGUF模型導入Jan AI是一種簡單的方法。 創建您可控制的本地人工智慧環境選擇合適的量化方法、調整 GPU 使用率以及保持 llama.cpp 更新通常足以運行各種各樣的模型,而無需不斷依賴網路。

Jan AI 無法偵測到顯示卡:原因及解決方法
相關文章:
一月份未偵測到 AI 和 GPU:原因及解決方案完整指南