如何在本地网络上与其他用户共享 Open WebUI

最后更新: 2026年16月07日

  • 基于 Open WebUI 和 Ollama 实现多用户聊天界面,用于本地部署。
  • 使用主机 IP、反向代理(如 Caddy)或 Cloudflare 隧道进行远程访问配置。
  • 使用 NVIDIA、AMD 和 Apple Silicon 上的 GPU 加速进行 LLM 推理的硬件优化。
  • 通过原生 RAG、自定义 Python 函数和 MCP 协议扩展功能。

如何在本地网络上与其他用户共享 Open WebUI

¿如何与本地网络上的其他用户共享 Open WebUI? 想象一下,你家客厅里就能运行着强大的高级语言模型,而你的数据无需经过任何大型科技公司的服务器。得益于以下技术的结合,搭建私有AI环境比以往任何时候都更加容易: Open WebUI 和 Ollama两者结合起来,可以创造出与 ChatGPT 完全相同的体验,但完全由您掌控。

对许多人来说,容器和托管的世界乍一看可能有点令人生畏,但一旦你理解了这一点,就会发现 Docker 是引擎 它简化了一切,操作自然流畅。无论您是想在家里的多台电脑上使用它,还是为您的工作团队设置一个助手,关键在于了解如何开放这项服务,以便其他设备也能加入。

这个生态系统究竟是什么?

为了避免名称混淆,重要的是要明白我们说的是两个不同的部件,它们可以完美地结合在一起。 Ollama是引擎处理器负责下载模型(例如 Llama 3.2 或 DeepSeek),并使用您的处理器或显卡运行它们。它是负责处理令牌等底层数据的技术层。

另一方面, Open WebUI 是可见的界面这是一个界面精美、现代的多用户网页界面,可连接到 Ollama。没有它,你只能通过枯燥的终端进行聊天;有了它,你就能拥有聊天记录、文档管理功能,以及即使在移动设备上也能完美运行的响应式设计。

独家内容 - 点击这里  如何解压 7z 文件

这种组合的最大优势在于: 完全隐私由于它不依赖外部 API 密钥或令牌计费,您可以随意进行实验,而不用担心超出预算或有人阅读您的私人提示。

使用 Docker 快速安装和部署

如何在Beszel中监控服务器和Docker

最快捷的启动方式是通过 Docker。如果您的系统上已经安装了 Ollama,则可以使用一条命令启动 Open WebUI,该命令会将容器的 8080 端口映射到您机器上的 3000 端口。务必使用该标志。 –add-host=host.docker.internal:host-gateway尤其是在 Linux 系统上,这样容器才能与主机上运行的 Ollama 服务器进行通信。

对于那些寻求更严肃、更专业服务的人来说, Docker Compose 这是最佳方案。它允许您在单个 YAML 文件中定义两种服务,并管理共享网络和命名卷。这确保您的 对话和场景得以保留 即使您删除或更新容器,也不会丢失所有累积的工作。

如果您在商业环境中工作,可以使用 Helm Charts 进行部署。 Kubernetes实现了大规模可扩展性和更强大的持久存储管理。

如何向网络上的其他用户开放访问权限

很多人都卡在这里了。默认情况下,如果您输入 localhost:3000只有您本人才能访问该网站。如果您想让您的伙伴、同事或其他电脑访问该网站,您必须使用…… 本地IP地址 来自您的服务器(例如, http://192.168.1.15:3000如果无法加载,很可能是 Windows 或 Ubuntu 防火墙阻止了该端口。

如果你想更进一步,不再依赖于更改 IP 地址,你可以使用反向代理。 卡迪是个宝贝 由于其简便性,只需五行文件即可自动获取 SSL 证书,并使用干净的域名进行访问。如果您无法控制 DNS, Cloudflare隧道 它们简直是救星,因为它们无需在路由器上打开端口即可访问网络。

独家内容 - 点击这里  在 MATLAB 中创建矩阵

一条重要的安全提示:切勿在未采取任何保护措施的情况下将其发布到公共互联网上。虽然用户注册默认启用,但理想情况下您应该…… 禁用注册选项 在管理面板中创建必要的帐户后,可以防止任何未知人员偷偷潜入您的服务器。

利用GPU加速性能

没有什么比反应迟钝的人工智能更令人沮丧的了。为了避免这种情况,至关重要的是…… Ollama 检测到了你的 GPU如果您使用的是 NVIDIA 显卡,则需要 NVIDIA Container Toolkit 才能让引擎访问显存。对于 AMD 显卡,在 Linux 系统上使用 ROCm 可以获得具有竞争力的性能。

对于Mac用户来说,有一个重要的细节需要注意: 原生运行 Ollama 而且不能在 Docker 容器内运行。这是因为 macOS 上的 Docker 不允许直接访问 Metal GPU,如果允许,模型将使用 CPU 运行,使你强大的 M2 或 M3 芯片变成一台过时的电脑。

根据硬件配置的不同,速度也会有所不同。苹果自研芯片的速度最高可达…… 每秒 50 个令牌 对于像 Llama 3.2 这样的小型模型,虽然需要更多的内存和耐心,但对于更复杂的模型,速度总是比任何软件模拟都要快。

利用 RAG、函数和 MCP 为 AI 赋能

如何让 Docker 容器在停止响应时自动重启

Open WebUI 不仅仅是一个聊天窗口,它还是一个可扩展的平台。它最强大的功能之一是…… 原生 RAG (基于检索的增强生成)。简单来说,您可以上传自己的 PDF 或 Word 文档,人工智能会将它们用作知识库。在聊天中输入 # 符号,即可调用特定的文档集合,从而获得超精准的回复。

独家内容 - 点击这里  如何打开TRA文件

如果你懂一点 Python,你就可以创建 函数和管道这些功能允许您向界面添加自定义按钮或过滤消息内容(例如,在敏感邮件到达模特之前将其删除)。另一方面,管道则充当外部路由器,可以将您的聊天与其他工具连接起来。

此外,……的到来 模型上下文协议(MCP) 它允许本地 AI 以标准化的方式与 Slack、GitHub 或您自己的本地文件等外部工具进行交互,将聊天变成真正的高效代理。

解决常见问题

最常见的错误是 Open WebUI 加载完毕,但模型列表为空。这是因为容器无法连接到 Ollama。解决方法通常是配置相关变量。 OLLAMA_BASE_URL 正确并确保 Ollama 不仅仅链接到 127.0.0.1, 直到 0.0.0.0 接受外部连接。

关于 RAG,如果您发现引用不准确,请尝试 减小片段大小 (数据块大小)。如果数据块太大,可能会使小型模型的上下文窗口饱和,导致人工智能无法跟踪原始问题。

为了保持系统更新,只需执行以下操作: docker pull 从最新镜像中恢复并重启容器。谢谢。 持久数据卷更新过程中,您不会丢失任何消息或自定义设置。

在家中部署人工智能服务器是一种绝佳的体验,它兼具隐私保护、基础设施学习能力以及开放模型的灵活性。从使用 Docker 命令进行基本安装,到使用代理和 RAG 知识库进行高级配置,Open WebUI 致力于成为那些不愿依赖云服务、更倾向于在本地网络上管理自身计算能力的用户的终极工具。