AI 编程助手本地安装入门:一步步跑通你的第一个模型
零基础学会在本地安装 Ollama 和 llama.cpp,运行 AI 编程助手,并解决工具调用和上下文长度的常见陷阱。
想在自己的电脑上跑一个 AI 编程助手?本文带你从零开始,装好环境、下载模型、第一次成功调用工具。你不需要懂深度学习,跟着步骤走就行。
准备环境
你需要一台带独立显卡的电脑(NVIDIA 显卡最佳),至少 8GB 显存。如果只有 CPU 也能跑,但会很慢。操作系统推荐 Windows 11 或 Ubuntu 22.04。
- Ollama:一个帮你一键下载和运行 AI 模型的工具。去 ollama.com 下载安装包,安装后打开终端(命令行)。
- llama.cpp:一个更底层的推理引擎,能让你精细控制模型行为。新手可以先不用它,用 Ollama 更简单。
安装步骤
- 安装 Ollama:下载后双击安装,一路默认即可。安装后打开终端(Windows 按 Win+R 输入 cmd,Mac/Linux 打开 Terminal)。
- 下载一个模型:在终端输入
ollama pull qwen2.5-coder:7b,等待下载完成(约 4GB)。这是阿里出品的编程专用模型,适合新手。 - 运行模型:输入
ollama run qwen2.5-coder:7b,看到提示符后输入“写一个 Python 冒泡排序”,模型会回复代码。 - 设置上下文长度:默认上下文只有 4096 个 token(相当于约 3000 字),对编程助手不够。在终端输入
set OLLAMA_CONTEXT_LENGTH=65536(Windows)或export OLLAMA_CONTEXT_LENGTH=65536(Mac/Linux),然后重新运行模型。如果不设置,模型会在处理长对话时悄悄丢掉你之前的内容。
验证是否成功
运行模型后,试试以下任务:
- 让它写一个完整的网页(HTML+CSS+JS)。
- 让它解释一段复杂代码。
- 让它连续改三次代码(比如先写函数,再加异常处理,再优化性能)。如果它能在第三次时还记得第一次的代码,说明上下文长度设置正确。
如果模型回答明显中断或忘记上下文,八成是上下文长度没设够。检查环境变量 OLLAMA_CONTEXT_LENGTH 是否生效。
下一步可以做什么
- 安装 Continue.dev:这是一个 VS Code 插件,让你在编辑器里直接调用 Ollama 模型,像用 GitHub Copilot 一样。在 VS Code 扩展市场搜索“Continue”安装,然后配置它连接本地 Ollama。
- 尝试更强大的模型:比如
qwen2.5-coder:14b(需要 12GB 显存)或deepseek-coder-v2:16b。在终端用ollama pull 模型名下载。 - 学习工具调用:高级用户可以尝试 llama.cpp 的 llama-server,它支持让模型调用外部工具(比如搜索网页、执行代码)。但新手先用 Ollama 熟悉基础。
内容来源
DEV Ollama
发布时间
2026-07-29 01:31