本地AI入门:装个Ollama,跑通你的第一个模型
从零开始,教你安装Ollama、下载模型、运行三种典型任务,快速验证本地AI能不能用。
准备环境
在开始之前,你需要一台电脑(Windows/Mac/Linux都行)和基本的命令行操作能力。别担心,我们只用几条命令。
- Ollama 是一个让你在本地运行AI模型的工具,就像“AI的播放器”——你下载模型(相当于“歌曲”),然后用Ollama来“播放”。
- 访问 ollama.com,下载对应你操作系统的安装包。Windows用户下载.exe,Mac用户下载.dmg,Linux用户复制安装命令。
- 安装过程很简单:双击运行,一路“下一步”即可。装完后打开终端(Windows搜cmd或PowerShell,Mac/Linux打开“终端”应用)。
安装与下载模型
Ollama装好后,我们来下载一个模型。模型就是AI的大脑,这里我们用两个常见的模型做测试。
- 在终端输入
ollama pull llama3.1:8b,按回车。这会下载一个8B参数的模型(约4.7GB),适合大多数电脑。等待下载完成(显示“success”)。 - 再输入
ollama pull gemma4:26b,下载一个更大的模型(约15GB)。如果你的内存(RAM)小于16GB,可以跳过这一步,只测试小模型。
常见坑:下载很慢?可以尝试切换网络或使用代理。如果内存不够,Ollama会报错“out of memory”,这时换小模型即可。
验证是否成功
模型下载好了,我们来跑三种典型任务,看看AI的真实速度。
- 短对话测试:输入
ollama run llama3.1:8b,进入交互模式。输入“你好,请用一句话介绍自己”,看它回复的速度。按Ctrl+D退出。 - 长文本摘要测试:输入
ollama run llama3.1:8b "请用一句话总结以下文章:" 并粘贴一段长文本(比如500字)。注意观察它“思考”的时间。 - 代码任务测试:输入
ollama run llama3.1:8b "用Python写一个计算斐波那契数列的函数"。看它能否生成正确代码。
如果你想看更详细的速度数据,可以用 ollama run llama3.1:8b --verbose,它会显示每秒生成的token数(token是AI处理的最小语言单位,可以理解为“字词碎片”)。比如在我的机器上,短对话约228 tokens/秒,长文本约206 tokens/秒。
下一步可以做什么
现在你已经能跑模型了!可以尝试:
- 使用Ollama的API:在终端启动服务
ollama serve,然后用Python或curl调用。 - 下载更多模型:访问 Ollama模型库,找到你感兴趣的模型(比如Mistral、Qwen),用
ollama pull 模型名下载。 - 注意:大模型(如gemma4:26b)第一次加载可能慢(约2分钟),之后如果保持服务运行,后续请求会快很多。
内容来源
DEV Ollama
发布时间
2026-07-29 01:31