AI 入门:一步步安装并跑通你的第一个抓取脚本
零基础也能学会:下载 Python、安装必要库、运行抓取 Indeed 职位列表的脚本,并验证成功。
想不想让电脑自动帮你抓取招聘网站上的职位信息?今天我们就从零开始,一步步装好环境,跑通第一个 AI 抓取脚本。整个过程不需要任何编程基础,跟着做就好。
1. 准备环境:安装 Python
首先,我们需要一个叫 Python 的工具。你可以把它理解成“让电脑听话的语言翻译官”,我们写的指令它都能听懂。
- 去 Python 官网(python.org)下载最新版本。
- 安装时,一定记得勾选“Add Python to PATH”(把 Python 加到系统路径里),不然后面会找不到命令。
- 安装完成后,打开终端(Windows 上是 CMD 或 PowerShell,Mac 上是“终端”App),输入
python --version,看到版本号就说明装好了。
2. 安装必要库:让 Python 学会抓网页
Python 本身不会抓网页,需要装一些“插件”,专业叫 库。这里我们只需要两个:requests(用来下载网页)和 beautifulsoup4(用来解析网页内容,就像用放大镜看网页结构)。
- 在终端里输入
pip install requests beautifulsoup4,回车。 - 等待安装完成,看到“Successfully installed”就成功了。
3. 写一个最简单的抓取脚本
现在我们来写一个几行的小脚本,抓取 Indeed 首页的标题。新建一个文本文件,命名为 first_scraper.py,把下面的代码复制进去:
import requests
from bs4 import BeautifulSoup
url = 'https://www.indeed.com'
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
print(soup.title.text)
这段代码的意思是:用 requests 下载 Indeed 的首页,再用 BeautifulSoup 解析,最后把网页标题打印出来。
4. 运行并验证成功
在终端里,先切换到脚本所在的文件夹(用 cd 命令),然后输入 python first_scraper.py,回车。如果看到输出类似“Jobs, Employment | Indeed.com”,就说明你成功了!
常见坑:如果报错“No module named 'requests'”,说明库没装好,重新执行第 2 步。如果报错“SSL”相关,可能是网络问题,换个网络试试。
5. 下一步可以做什么
你已经跑通了第一个抓取脚本!接下来可以尝试:
- 修改 URL,抓取特定关键词的职位列表。
- 学习用 BeautifulSoup 提取职位标题、公司名等具体信息。
- 把结果保存到 Excel 文件里,方便查看。
记住,这只是 AI 和编程的冰山一角,但你已经迈出了第一步。继续加油!
内容来源
DEV Tutorial
发布时间
2026-08-03 01:30