极客前沿

一步步学会本地AI:安装Ollama并看懂耗时

2026-08-03 01:31
DEV Ollama
查看原文

学会安装Ollama,运行本地模型,并解读耗时数据,优化性能。

想在本机跑AI,但怕麻烦?其实很简单。本文带你装好Ollama(一个让本地AI运行更简单的工具),跑通第一个模型,并学会看耗时数据。

准备环境

先检查电脑:Windows/Mac/Linux都行,最好有NVIDIA显卡,内存8GB以上。

Tutorial Image
  • 去 ollama.com 下载安装包,双击安装。
  • 安装后,打开终端(Mac/Linux)或命令提示符(Windows),输入ollama --version,看到版本号就成功了。

安装并运行第一个模型

  1. 在终端输入ollama run qwen3:0.6b,它会自动下载并运行一个较小的模型。
  2. 等出现“Send a message”,输入“你好”,回车,它会回复你。
  3. 想退出,输入/bye

如果下载慢,可设置镜像:OLLAMA_HOST=127.0.0.1:11434,或手动下载模型文件。

看懂耗时数据

运行模型时,Ollama会显示速度(如tokens/秒,即每秒生成多少个字)。但只看这个不够,我们还要知道每个阶段花多久。

Tutorial Image

ollama generate命令,并加"verbose":true,会返回更详细的时间:

  • load_duration:加载模型的时间。若模型没在内存,第一次会久。
  • prompt_eval_duration:理解你输入的时间。
  • eval_duration:生成回复的时间。
  • total_duration:总时间。

比如,某次运行显示加载用了8秒,生成只用1秒,那优化重点就是减少加载(如常驻模型)。

下一步可以做什么

  • 试更多模型:ollama run qwen3:1.7b,体验不同大小。
  • ollama list查看已下载的模型。
  • 写个Python脚本调用API,做自己的小应用。

记住:跑通只是开始,学会看数据才能调优。

内容来源

DEV Ollama

发布时间

2026-08-03 01:31

返回 AI技术