- 它允许您在本地运行强大的语言模型(LLM),保证完全的隐私,并且无需互联网连接即可运行。
- 它兼容 Windows、macOS 和 Linux 系统,主要要求 GPU 拥有足够的显存才能达到最佳性能。
- 它提供了一个包含大量模型的库,这些模型专门用于通用聊天、编程和高级推理,可以通过 API 或图形界面进行集成。
如何使用 Ollama 下载并运行您的第一个模型? 想象一下,你的电脑里直接住着一个强大的人工智能,你无需支付月费,也不用担心加州的公司会窃取你的秘密。 运行本地语言模型 由于各种工具消除了所有技术障碍,使得智能聊天变得异常简单,我们可以在几分钟内从零开始进行智能聊天。
这时 Ollama 就派上了用场,它是一个基本上充当以下角色的平台: Docker 人工智能它的神奇之处在于管理了整个繁琐的过程:从下载模型和优化内存到执行,为程序员和那些只想尝试人工智能而又不想破坏任何东西的人提供了流畅的体验。
为什么要在本地安装人工智能?

主要原因无疑是…… 绝对隐私使用云服务时,您的数据会通过互联网传输;而使用 Ollama,信息永远不会离开您的设备,这对于处理机密文件或敏感数据至关重要。此外,您也无需担心…… 每个代币的成本 或者每月支付 20 欧元的费用,因为一旦模型下载完成,即可完全免费使用。
另一个优势是能够 无需网络即可工作你可以带着笔记本电脑上飞机或去偏远地区,仍然拥有一个能够编程或撰写文本的助手。最后,灵活性是完全的:你可以创建 定制模型 通过名为模型文件的配置文件,根据您的喜好调整 AI 的个性和行为。
硬件:需要哪些硬件才能使其不依赖踏板运行?
你不需要超级计算机,但你必须对自身资源有清醒的认识。瓶颈永远都会在…… 显卡显存如果您拥有 NVIDIA 或 AMD 的 GPU,Ollama 将充分利用其性能实现即时响应。如果您只有 CPU,它也能运行,但速度会大幅下降,从每秒生成几十个单词骤降至每秒几个单词。
- 轻量级型号(1-3B): 8GB 内存和 4GB 显存,绰绰有余。像 Gemma 2 2B 这样的程序非常适合执行简单的任务。
- 中型模型(7-8B): 这里,标准配置是16GB内存和8GB显存。这正是Llama 3.1 8B或Mistral的定位,它们提供…… 质量与速度的完美平衡.
- 大型模型(13-70B+): 现在我们进入专业领域了。对于70B型号,您至少需要64GB的内存和40GB或以上显存的显卡。
对于那些使用 苹果芯片(M1、M2、M3、M4)得益于统一内存,GPU 可以访问系统的所有 RAM,因此体验非常棒。
分步安装指南

安装 Ollama 几乎只需单击一下即可完成,具体取决于您的操作系统:
- 在Windows系统上: 从官方网站下载 .exe 文件并安装,安装后您将在系统托盘中看到 Ollama 图标。如果您想 更改模型保存路径。 (因为 C 盘很快就会被填满),你需要创建一个名为 的环境变量 烤箱型号 输入您首选文件夹的路径。
- 在 macOS 系统上: 只需下载 .dmg 文件,然后将应用程序拖到“应用程序”文件夹即可。
- 在Linux系统上: 只需一条命令行即可完成:
curl -fsSL https://ollama.com/install.sh | sh这将自动配置 systemd 服务。
为了检查一切是否正常,请打开终端并输入 ollama --version如果它返回版本号,你就成功了。
你与模型的第一步
要启动人工智能,无需进行任何复杂的配置,只需使用命令即可。 跑步。 例如,如果你写 ollama run llama3.1系统将自动下载模板并在终端打开交互式聊天窗口。要退出,只需输入 /bye.
推荐型号目录

并非所有型号都适用于同一用途。根据您的目标,其中一种型号会更合适:
- 一般用途: Llama 3.3 70B 是复杂推理的利器,而 Llama 3.1 8B 则是更适合日常使用的通用选择。
- 编程: DeepSeek Coder 和 Qwen 2.5 Coder 都是非常强大的工具。 自动完成代码和调试错误 直接在编辑器中输入。
- 高级推理: 如果您需要人工智能在做出响应之前进行逐步思考,DeepSeek-R1 是理想之选,其性能接近市场上顶级模型。
- 多模态: 如果你想要人工智能,LLaVA 就是完美之选。 分析图像 并描述其中的成分。
将 Ollama 提升到新的水平:接口和 API
如果您觉得终端过于简陋,您可以安装 Open WebUI这是一个网页界面,它模拟了 ChatGPT 的使用体验,但连接到您本地的 Ollama 设备。它使用 Docker 可以轻松安装,并允许您管理历史记录、上传 PDF 文件提问(RAG),以及一键切换型号。
对于开发者而言,Ollama 呈现了 端口 11434 上的 REST API 它与 OpenAI 完全兼容。这意味着您只需更改服务器 URL,即可将本地 AI 集成到任何 Python 或 JavaScript 应用程序中。甚至还有一些扩展程序,例如 继续开发 适用于 VS Code,可将 Ollama 变成您自己的私人副驾驶。
优化和维护技巧
为了使系统能够飞行,建议使用 量化模型 (例如 Q4_K_M),它可以在最大限度减少模型质量损失的情况下减小模型大小。如果您发现模型缺少某些内容,可以使用参数扩展上下文窗口。 --num-ctx此外,保持 NVIDIA 驱动程序更新至最新版本对于充分利用诸如以下技术至关重要: 闪光灯这样可以降低内存消耗。
Ollama 让本地人工智能触手可及,任何拥有配置不错的电脑的用户都可以部署从编程助手到私人文档分析系统的各种应用。凭借其简洁的命令行架构、与 Open WebUI 等可视化界面的集成以及对庞大开源模型库的兼容性,用户不再需要依赖云端即可驾驭本地逻辑模型 (LLM) 的强大功能。
从小就对科技充满热情。我喜欢了解该领域的最新动态,最重要的是,进行交流。这也是我多年来致力于科技和视频游戏网站交流的原因。您可以找到我撰写的有关 Android、Windows、MacOS、iOS、任天堂或您想到的任何其他相关主题的文章。