一步步学会本地AI:安装Ollama并看懂耗时
学会安装Ollama,运行本地模型,并解读耗时数据,优化性能。
想在本机跑AI,但怕麻烦?其实很简单。本文带你装好Ollama(一个让本地AI运行更简单的工具),跑通第一个模型,并学会看耗时数据。
准备环境
先检查电脑:Windows/Mac/Linux都行,最好有NVIDIA显卡,内存8GB以上。
- 去 ollama.com 下载安装包,双击安装。
- 安装后,打开终端(Mac/Linux)或命令提示符(Windows),输入
ollama --version,看到版本号就成功了。
安装并运行第一个模型
- 在终端输入
ollama run qwen3:0.6b,它会自动下载并运行一个较小的模型。 - 等出现“Send a message”,输入“你好”,回车,它会回复你。
- 想退出,输入
/bye。
如果下载慢,可设置镜像:OLLAMA_HOST=127.0.0.1:11434,或手动下载模型文件。
看懂耗时数据
运行模型时,Ollama会显示速度(如tokens/秒,即每秒生成多少个字)。但只看这个不够,我们还要知道每个阶段花多久。
用ollama generate命令,并加"verbose":true,会返回更详细的时间:
- load_duration:加载模型的时间。若模型没在内存,第一次会久。
- prompt_eval_duration:理解你输入的时间。
- eval_duration:生成回复的时间。
- total_duration:总时间。
比如,某次运行显示加载用了8秒,生成只用1秒,那优化重点就是减少加载(如常驻模型)。
下一步可以做什么
- 试更多模型:
ollama run qwen3:1.7b,体验不同大小。 - 用
ollama list查看已下载的模型。 - 写个Python脚本调用API,做自己的小应用。
记住:跑通只是开始,学会看数据才能调优。
内容来源
DEV Ollama
发布时间
2026-08-03 01:31