极客前沿

AI 入门:一步步安装并跑通你的第一个抓取脚本

2026-08-03 01:30
DEV Tutorial
查看原文

零基础也能学会:下载 Python、安装必要库、运行抓取 Indeed 职位列表的脚本,并验证成功。

想不想让电脑自动帮你抓取招聘网站上的职位信息?今天我们就从零开始,一步步装好环境,跑通第一个 AI 抓取脚本。整个过程不需要任何编程基础,跟着做就好。

1. 准备环境:安装 Python

首先,我们需要一个叫 Python 的工具。你可以把它理解成“让电脑听话的语言翻译官”,我们写的指令它都能听懂。

  • 去 Python 官网(python.org)下载最新版本。
  • 安装时,一定记得勾选“Add Python to PATH”(把 Python 加到系统路径里),不然后面会找不到命令。
  • 安装完成后,打开终端(Windows 上是 CMD 或 PowerShell,Mac 上是“终端”App),输入 python --version,看到版本号就说明装好了。

2. 安装必要库:让 Python 学会抓网页

Python 本身不会抓网页,需要装一些“插件”,专业叫 。这里我们只需要两个:requests(用来下载网页)和 beautifulsoup4(用来解析网页内容,就像用放大镜看网页结构)。

  1. 在终端里输入 pip install requests beautifulsoup4,回车。
  2. 等待安装完成,看到“Successfully installed”就成功了。

3. 写一个最简单的抓取脚本

现在我们来写一个几行的小脚本,抓取 Indeed 首页的标题。新建一个文本文件,命名为 first_scraper.py,把下面的代码复制进去:

Tutorial Image
import requests
from bs4 import BeautifulSoup

url = 'https://www.indeed.com'
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
print(soup.title.text)

这段代码的意思是:用 requests 下载 Indeed 的首页,再用 BeautifulSoup 解析,最后把网页标题打印出来。

4. 运行并验证成功

在终端里,先切换到脚本所在的文件夹(用 cd 命令),然后输入 python first_scraper.py,回车。如果看到输出类似“Jobs, Employment | Indeed.com”,就说明你成功了!

常见坑:如果报错“No module named 'requests'”,说明库没装好,重新执行第 2 步。如果报错“SSL”相关,可能是网络问题,换个网络试试。

5. 下一步可以做什么

你已经跑通了第一个抓取脚本!接下来可以尝试:

  • 修改 URL,抓取特定关键词的职位列表。
  • 学习用 BeautifulSoup 提取职位标题、公司名等具体信息。
  • 把结果保存到 Excel 文件里,方便查看。

记住,这只是 AI 和编程的冰山一角,但你已经迈出了第一步。继续加油!

内容来源

DEV Tutorial

发布时间

2026-08-03 01:30

返回 AI技术