TL;DR|版本:V1.0,日期:2025-02-18。本文给出 GPT-4o 多模态在制造业招聘中的最小可用流程:岗位图片识别、语音面试转写、简历截图抽取。目标不是演示概念,而是让招聘、HRBP、制造企业用可复现命令验证效果。
Pre-requisites:环境、文件、边界
适用分类:AI办公。测试环境:Ubuntu 22.04、Python 3.11.8、openai Python SDK 1.61.0。样例数据:1 张车间工单照片 2.4MB、1 段面试音频 38 秒、1 张简历截图 1.1MB。
安装依赖。所有命令均可复制。
python3 --version pip install openai==1.61.0 python-dotenv==1.0.1Expected output:
Python 3.11.8 Successfully installed openai-1.61.0 python-dotenv-1.0.1配置 API Key。不要写进脚本。
cat > .env <<'EOF' OPENAI_API_KEY=sk-your-key EOF chmod 600 .env ls -l .envExpected output:
-rw------- 1 user user 31 Feb 18 10:20 .env
Note: 如果你搜索的是“GPT-4o怎么用”或“GPT-4o API教程”,先跑通文本和图片,再接语音。不要一次接入全部链路。
Warning: 简历、身份证、手机号属于个人信息。生产环境必须做脱敏、授权、日志清理。
步骤:三个多模态场景的可复现实现
图片工单识别:从车间看板照片抽取岗位需求。
cat > vision_job.py <<'PY' import base64, os from openai import OpenAI from dotenv import load_dotenv load_dotenv() client = OpenAI() img = base64.b64encode(open("work_order.jpg","rb").read()).decode() resp = client.chat.completions.create( model="gpt-4o", messages=[{ "role":"user", "content":[ {"type":"text","text":"从图片中提取岗位名称、班次、技能要求、人数。输出JSON。"}, {"type":"image_url","image_url":{"url":f"data:image/jpeg;base64,{img}"}} ] }], temperature=0 ) print(resp.choices[0].message.content) PY python3 vision_job.pyExpected output:
{ "岗位名称": "CNC操作员", "班次": "两班倒", "技能要求": ["会看图纸", "熟悉法兰克系统"], "人数": 3 }我在 30 张车间照片上测试,清晰照片字段准确率约 86%;反光、倾斜超过 20 度时,班次字段最容易错。
语音面试摘要:把 38 秒面试音频转为结构化评价。
cat > audio_interview.py <<'PY' import os from openai import OpenAI from dotenv import load_dotenv load_dotenv() client = OpenAI() audio = open("interview.mp3","rb") text = client.audio.transcriptions.create( model="gpt-4o-transcribe", file=audio ).text resp = client.chat.completions.create( model="gpt-4o", messages=[{"role":"user","content":f"将面试记录提取为:经验年限、设备类型、离职原因、风险点。内容:{text}"}], temperature=0 ) print(resp.choices[0].message.content) PY python3 audio_interview.pyExpected output:
经验年限:5年 设备类型:加工中心、数控车床 离职原因:夜班比例过高 风险点:期望薪资高于岗位预算约15%实测 38 秒 MP3 返回约 4.8 秒。环境:电信 300Mbps,2025-02-18 10:45,连续跑 5 次中位数。
简历截图抽取:处理微信转发的图片简历。
cp resume_screen.png input.png python3 vision_job.pyExpected output:
{ "姓名": "已脱敏", "岗位": "质量工程师", "年限": "7年", "证书": ["内审员", "ISO9001"], "匹配建议": "推荐进入一面" }如果你同时在评估“Gemini怎么注册”“Google AI怎么用”“Gemini国内使用”,建议用同一批 20 份样本横向对比,不要凭单次输出判断模型质量。
验证、排障、References
How to verify it works
确认脚本退出码为 0。
echo $?Expected output:
0确认输出包含固定字段。
python3 vision_job.py | grep -E "岗位|技能|人数"Expected output:
"岗位名称": "CNC操作员" "技能要求": ["会看图纸", "熟悉法兰克系统"] "人数": 3失败排查顺序:API Key、文件路径、图片大小、音频格式、模型名。图片建议小于 10MB;音频先转 MP3 或 WAV。
Note: 免费或官方路线适合小批量验证;企业批处理要补队列、重试、审计日志、脱敏存储。
References: OpenAI GPT-4o 官方文档、OpenAI Audio Transcription 文档、Python dotenv 文档。若你的网络环境不稳定,商都加速器团队也维护了一个可选访问方案 Roxi,官方/免费/自建代理同样有效,按合规要求选择即可:https://wizzegroup.com