# OCR技能 - 从图片PDF中提取文字

## 用途
将扫描版PDF或图片中的文字识别出来（西班牙语/英语）

## 前置要求
- 安装 tesseract: `brew install tesseract`
- 安装图片处理工具 (sips已内置)

## 使用步骤

### 1. PDF转图片
```bash
pdfimages -png 文件.pdf /tmp/page
```

### 2. 转换为JPEG格式
```bash
cd /tmp
for i in 0 1 2 3 4 5 6; do
  sips page-00$i.png -s format jpeg --out page-00$i.jpg
done
```

### 3. OCR识别
```bash
# 英语
tesseract page-00.jpg stdout -l eng

# 西班牙语 (需要下载语言包)
# brew install tesseract --with-spanish
tesseract page-00.jpg stdout -l spa
```

### 4. 批量处理
```bash
cd /tmp
for i in 0 1 2 3 4 5 6; do
  echo "=== Page $i ===" 
  tesseract page-00$i.jpg stdout -l eng 2>/dev/null
done > /tmp/ocr_result.txt
```

## 语言包
- 默认只有: eng, osd, snum
- 西班牙语需要: spa
- 下载: https://github.com/tesseract-ocr/tessdata

## 注意事项
- OCR结果可能有误差，需人工校对
- 图片质量影响识别准确率
- 使用 `-l eng` 识别西班牙语会有一些错误，但能理解大意
