极客前沿

本地AI入门:装个Ollama,跑通你的第一个模型

2026-07-29 01:31
DEV Ollama
查看原文

从零开始,教你安装Ollama、下载模型、运行三种典型任务,快速验证本地AI能不能用。

准备环境

在开始之前,你需要一台电脑(Windows/Mac/Linux都行)和基本的命令行操作能力。别担心,我们只用几条命令。

  • Ollama 是一个让你在本地运行AI模型的工具,就像“AI的播放器”——你下载模型(相当于“歌曲”),然后用Ollama来“播放”。
  • 访问 ollama.com,下载对应你操作系统的安装包。Windows用户下载.exe,Mac用户下载.dmg,Linux用户复制安装命令。
  • 安装过程很简单:双击运行,一路“下一步”即可。装完后打开终端(Windows搜cmd或PowerShell,Mac/Linux打开“终端”应用)。

安装与下载模型

Ollama装好后,我们来下载一个模型。模型就是AI的大脑,这里我们用两个常见的模型做测试。

Tutorial Image
  1. 在终端输入 ollama pull llama3.1:8b,按回车。这会下载一个8B参数的模型(约4.7GB),适合大多数电脑。等待下载完成(显示“success”)。
  2. 再输入 ollama pull gemma4:26b,下载一个更大的模型(约15GB)。如果你的内存(RAM)小于16GB,可以跳过这一步,只测试小模型。

常见坑:下载很慢?可以尝试切换网络或使用代理。如果内存不够,Ollama会报错“out of memory”,这时换小模型即可。

验证是否成功

模型下载好了,我们来跑三种典型任务,看看AI的真实速度。

Tutorial Image
  • 短对话测试:输入 ollama run llama3.1:8b,进入交互模式。输入“你好,请用一句话介绍自己”,看它回复的速度。按Ctrl+D退出。
  • 长文本摘要测试:输入 ollama run llama3.1:8b "请用一句话总结以下文章:" 并粘贴一段长文本(比如500字)。注意观察它“思考”的时间。
  • 代码任务测试:输入 ollama run llama3.1:8b "用Python写一个计算斐波那契数列的函数"。看它能否生成正确代码。

如果你想看更详细的速度数据,可以用 ollama run llama3.1:8b --verbose,它会显示每秒生成的token数(token是AI处理的最小语言单位,可以理解为“字词碎片”)。比如在我的机器上,短对话约228 tokens/秒,长文本约206 tokens/秒。

下一步可以做什么

现在你已经能跑模型了!可以尝试:

  • 使用Ollama的API:在终端启动服务 ollama serve,然后用Python或curl调用。
  • 下载更多模型:访问 Ollama模型库,找到你感兴趣的模型(比如Mistral、Qwen),用 ollama pull 模型名 下载。
  • 注意:大模型(如gemma4:26b)第一次加载可能慢(约2分钟),之后如果保持服务运行,后续请求会快很多。

内容来源

DEV Ollama

发布时间

2026-07-29 01:31