Cách tích hợp LobeHub với Ollama để sử dụng LLM cục bộ

Cập nhật lần cuối: 26/08/2026
Tác giả: Alberto Navarro

  • LobeHub cho phép bạn quản lý các mô hình Ollama cục bộ với giao diện chuyên nghiệp và không mất phí token.
  • Cấu hình này yêu cầu điều chỉnh các biến môi trường như OLLAMA_ORIGINS để tránh hiện tượng chặn CORS.
  • Có thể tối ưu hóa tốc độ phản hồi bằng cách điều chỉnh thời gian lưu trú của mô hình trên GPU.
  • Khả năng tương thích với API của OpenAI giúp việc di chuyển ứng dụng từ môi trường đám mây sang môi trường cục bộ trở nên dễ dàng hơn.
Cách kết nối LobeHub với Ollama

Nếu bạn say mê thế giới trí tuệ nhân tạo nhưng còn hơi do dự khi đưa dữ liệu của mình lên đám mây hoặc không muốn theo dõi giá của từng token, thì bạn đã đến đúng nơi. Sự kết hợp của... LobeHub và Ollama Về cơ bản, đây là giấc mơ của bất kỳ người đam mê quyền riêng tư và kiểm soát kỹ thuật nào, cho phép bạn thiết lập trung tâm điều khiển LLM của riêng mình trên máy tính cá nhân.

Điều tuyệt vời nhất là bạn không cần phải là chuyên gia hệ thống để thiết lập và vận hành nó. LobeHub đã tích hợp rất liền mạch đến mức bạn có thể chuyển đổi dễ dàng từ mô hình OpenAI hoặc Claude sang mô hình cục bộ của mình. Llama 3.1 hoặc Mistral mà không hề nhận thấy sự thay đổi nào về giao diện, luôn duy trì trải nghiệm người dùng hoàn hảo và chuyên nghiệp.

LocalAI hay Ollama: Nên chọn máy chủ cục bộ nào?
Bài viết liên quan:
LocalAI vs Ollama: Hướng dẫn đầy đủ về cách chọn máy chủ AI cục bộ

Ollama thực chất là gì và nó có liên quan như thế nào đến LobeHub?

Ollama thực chất là gì và nó có liên quan như thế nào đến LobeHub?

Ollama là một môi trường cực kỳ mạnh mẽ được thiết kế cho chạy các mô hình ngôn ngữ lớn (LLM) cục bộThay vì dựa vào máy chủ từ xa, quá trình xử lý diễn ra trên GPU hoặc CPU của chính bạn. Trong khi đó, LobeHub đóng vai trò là lớp trực quan và tổ chức, tích hợp liền mạch với Ollama để bạn không phải vật lộn với thiết bị đầu cuối mỗi khi muốn trò chuyện với AI của mình.

Nội dung độc quyền - Bấm vào đây  Cách sử dụng Word trên máy Mac?

Sự kết hợp này cho phép bạn tận dụng những mô hình tiên tiến như... Gemma 2 hoặc DeepSeek Trực tiếp thông qua giao diện trò chuyện trực quan. Hơn nữa, LobeHub đơn giản hóa việc quản lý các mô hình này, cho phép bạn tải xuống chúng thông qua thông báo trong ứng dụng đơn giản hoặc sử dụng dòng lệnh nếu bạn muốn kiểm soát hoàn toàn quá trình cài đặt.

Cách kết nối LibreChat với Ollama
Bài viết liên quan:
Làm thế nào để kết nối LibreChat với Ollama để có AI cục bộ?

Hướng dẫn cài đặt theo hệ điều hành của bạn

Thiết lập đa màn hình của một nhà phát triển tại nhà, minh họa quy trình làm việc nâng cao trong quản lý LLM.

Để mọi việc diễn ra suôn sẻ, bước đầu tiên là Cài đặt Ollama trên Windows hoặc hệ thống bạn ưa thích. Tùy thuộc vào thiết bị bạn sử dụng, quy trình sẽ có chút khác biệt nhưng luôn đơn giản:

  • Trên macOS: Sau khi cài đặt ứng dụng, điều cần thiết là phải cấu hình các biến môi trường cần thiết và khởi động lại chương trình để LobeHub có thể giao tiếp với nó.
  • Trên Windows: Hệ thống kế thừa các biến người dùng. Bạn cần đóng hoàn toàn Ollama từ biểu tượng khay hệ thống, chỉnh sửa các biến hệ thống trong bảng điều khiển và khởi động lại dịch vụ.
  • Trên Linux: Nó thường được quản lý thông qua systemdBạn cần chỉnh sửa dịch vụ bằng lệnh sau: systemctl edit ollama.serviceThêm các biến vào phần [Service], lưu lại và tải lại trình nền hệ thống.
  • Thông qua Docker: Nếu bạn thích sử dụng container, bạn có thể khởi chạy Ollama và LobeHub bằng các lệnh Docker, định nghĩa trực tiếp các biến môi trường trong hướng dẫn thực thi.
Cách tạo trợ lý AI mà không cần viết một dòng mã nào bằng Dify
Bài viết liên quan:
Cách kết nối Dify với Ollama để tạo ra một AI cục bộ, riêng tư.

Tường CORS: Cấu hình truy cập từ xa

Theo mặc định, Ollama rất nghiêm ngặt về bảo mật và chỉ cho phép kết nối từ máy cục bộ. Nếu bạn muốn LobeHub (đặc biệt nếu nó đang chạy trên Docker) truy cập vào các mô hình, bạn cần cấu hình... truy cập xuyên nguồn gốcĐể làm được điều này, việc định nghĩa biến là điều cần thiết. OLLAMA_ORIGINS.

Nếu bạn muốn tránh các rắc rối và cho phép truy cập đầy đủ, bạn có thể đặt giá trị là «*»Tuy nhiên, lý tưởng nhất là nên chỉ rõ các miền được phép. Tương tự như vậy, biến số OLLAMA_HOST Điều này rất quan trọng: nếu bạn sử dụng 0.0.0.0Dịch vụ sẽ lắng nghe trên tất cả các giao diện mạng, giúp các máy hoặc container khác dễ dàng kết nối đến cổng. 11434.

Nội dung độc quyền - Bấm vào đây  Làm thế nào để thay đổi ngôn ngữ mặc định trong Ball Blast?

Quản lý mô hình và hiệu suất nâng cao

Không phải tất cả các mô hình đều giống nhau, và chúng cũng không tiêu thụ cùng một lượng điện năng. Ollama cung cấp một thư viện khổng lồ để bạn có thể chọn mô hình phù hợp nhất với phần cứng của mình. LobeHub đã được bao gồm sẵn. được cấu hình sẵn với các tính năng phổ biến nhấtDo đó, khi bạn chọn chúng lần đầu tiên, công cụ sẽ tự động đề xuất bạn tải xuống.

Đối với những người am hiểu kỹ thuật hơn, có những thông số quan trọng cần lưu ý. Tăng tốc Ollama và cải thiện hiệu suất. Từ kinh nghiệm. Ví dụ, biến số OLLAMA_KEEP_ALIVE Điều này quyết định thời gian mô hình được lưu trữ trong bộ nhớ GPU. Nếu bạn nhận thấy phản hồi đầu tiên mất rất lâu (điều này khá phổ biến). thời gian khởi tạo), bạn có thể tăng giá trị này hoặc đặt nó thành -1 để mô hình không bao giờ được tải xuống, loại bỏ độ trễ trong các yêu cầu liên tiếp.

Lập trình viên đang làm việc trên MacBook Pro với mã nguồn hiển thị trên màn hình và hai màn hình.
Bài viết liên quan:
Cách kết nối Tiếp tục với Ollama để lập trình với AI cục bộ

Triển khai cho nhà phát triển và tự động hóa

Lập trình viên phần mềm làm việc tại văn phòng tại nhà với hai màn hình, nắm bắt được bản chất của việc điều khiển AI cục bộ.

Nếu bạn là lập trình viên, thư viện JavaScript của Ollama là một viên ngọc quý. Nó cho phép bạn sử dụng ollama.chat() cho các cuộc trò chuyện đã diễn ra và ollama.generate() Để có được các phản hồi duy nhất. Để thu được dữ liệu có cấu trúc mà không có lỗi, tốt nhất nên sử dụng zodToJsonSchemaĐảm bảo rằng AI trả về một JSON hợp lệ và có kiểu dữ liệu.

Nội dung độc quyền - Bấm vào đây  Hướng dẫn toàn diện về thời gian hoạt động của Kuma: Giám sát cơ sở hạ tầng của bạn một cách hiệu quả

Hơn nữa, Ollama tương thích với API của OpenAI. Điều này có nghĩa là bạn có thể sử dụng SDK của OpenAI chỉ bằng cách thay đổi... URL cơ sở đến địa chỉ cục bộ của bạn. Điều này thật sự rất tiện lợi nếu bạn đã viết sẵn mã và muốn chuyển nó sang môi trường cục bộ mà không cần phải viết lại từng hàm gọi mô hình.

Từ việc quản lý các embedding để tạo hệ thống RAG đến việc sử dụng các mô hình đa phương thức để phân tích hình ảnh, tính linh hoạt là hoàn chỉnh. Chỉ cần nhớ rằng phần cứng là giới hạn: việc cố gắng tải mô hình 70B trên máy có 8GB RAM sẽ dẫn đến lỗi. màn trình diễn thảm hại hoặc trong trường hợp ngừng hoạt động đột xuất.

Việc kết hợp LobeHub và Ollama giúp bạn kiểm soát hoàn toàn AI của mình, giải phóng bạn khỏi các khoản phí hàng tháng và những lo ngại về quyền riêng tư. Bằng cách cấu hình đúng cách các biến môi trường, quản lý vòng đời mô hình và tối ưu hóa bộ nhớ GPU, bạn biến máy tính của mình thành một máy chủ AI mạnh mẽ, có khả năng xử lý mọi thứ, từ các cuộc trò chuyện đơn giản đến quy trình làm việc tự động và phát triển phần mềm tiên tiến.

kết nối giữa Dify và Ollamama
Bài viết liên quan:
Cách kết nối Dify với Ollama để tạo Trí tuệ nhân tạo cục bộ