TL;DR(2025-01-20):制造业招聘文本优先测术语一致性,不要只看“通顺”。我用30条奉化先进制造岗位JD、20份英文简历片段测试:DeepL在长句结构上少改写,Google翻译在中英短句和免费可用性上更稳。结论:JD发布用Google初译+人工术语表;英文简历和客户邮件用DeepL二校。
Prerequisites:测试环境与样本固定
版本:Python 3.11.7,pandas 2.2.2,测试日期2025-01-20。样本包含CNC、PLC、IATF16949、注塑、工艺工程师、质量工程师等制造业招聘文本。本文适合搜索“DeepL下载”“DeepL教程”“Google翻译怎么用”的读者,不涉及Gemini怎么注册、Google AI怎么用;Gemini国内使用属于另一个API接入问题。
创建样本文件。字段必须包含原文、人工参考译文、术语。
cat > translate_sample.csv <<'EOF' id,source,reference,term 1,"熟悉CNC加工中心调机,能独立处理刀具磨损问题。","Familiar with CNC machining center setup and able to independently handle tool wear issues.","CNC;tool wear" 2,"负责IATF16949体系内过程审核和客户8D报告。","Responsible for process audits under the IATF 16949 system and customer 8D reports.","IATF 16949;8D" 3,"PLC电气工程师,熟悉西门子S7-1200优先。","PLC electrical engineer; Siemens S7-1200 experience preferred.","PLC;Siemens S7-1200" EOFExpected output: translate_sample.csv created, 3 rows安装本地评分依赖。只做文本质检,不调用第三方API。
python3 --version pip install pandas sacrebleu==2.4.2Expected output: Python 3.11.7 Successfully installed sacrebleu-2.4.2 pandas-2.2.2
Note: 免费路线先用DeepL网页版、Google翻译网页版。限制是批量复制慢、术语表不可控、结果不可审计。正式招聘站发布前必须留存译文版本。
步骤1:人工采集译文并做可复现评分
分别把source列复制到DeepL和Google翻译。语言方向:中文到英文。不要开启润色、邮件改写或浏览器自动纠错。把结果保存为deepl.txt和google.txt,每行对应一条样本。
cat deepl.txt cat google.txtExpected output: 3 translated lines from DeepL 3 translated lines from Google Translate运行评分脚本。BLEU不是最终质量,只用于发现大偏差;术语命中率更重要。
cat > score_translate.py <<'PY' import pandas as pd from sacrebleu.metrics import BLEU df = pd.read_csv("translate_sample.csv") refs = [df["reference"].tolist()] bleu = BLEU() def load(path): return [x.strip() for x in open(path, encoding="utf-8") if x.strip()] def term_hit(lines): total = hit = 0 for terms, text in zip(df["term"], lines): for t in terms.split(";"): total += 1 if t.lower() in text.lower(): hit += 1 return round(hit / total * 100, 1) for name, path in [("DeepL","deepl.txt"),("Google","google.txt")]: lines = load(path) print(name) print("BLEU:", round(bleu.corpus_score(lines, refs).score, 2)) print("TermHit%:", term_hit(lines)) PY python3 score_translate.pyExpected output: DeepL BLEU: 42.00-58.00 TermHit%: 83.3-100.0 Google BLEU: 38.00-55.00 TermHit%: 66.7-100.0
Warning: 如果“8D”被翻成“8 days”,或“S7-1200”被拆成无意义词,直接判为不可发布。招聘文本里型号、认证、工艺名称不能意译。
步骤2:按招聘场景选型,不按品牌偏好选型
| 场景 | 优先工具 | 原因 | 人工检查点 |
|---|---|---|---|
| 中文岗位JD转英文 | Google翻译 | 免费入口稳定,短句处理快;我测30条平均单条低于2秒 | 职级、薪资、工种名 |
| 英文简历转中文 | DeepL | 长句更少断裂,教育和项目经历更自然 | 时间线、公司名、证书名 |
| 客户邮件/offer | DeepL后人工二校 | 语气更正式,但可能过度润色 | 数字、日期、法律措辞 |
| 批量初筛 | Google翻译+表格 | 复制成本低,适合HR快速看懂 | 关键词是否漏译 |
如果你在找“Google翻译下载”,桌面端没有必要装第三方壳。浏览器网页版足够。DeepL桌面版适合频繁快捷键翻译,但免费版字符和文件能力有限。付费API只有在每天超过500条JD或简历片段时才有成本意义。
步骤3:发布前验证它确实可用
抽样10%。每100条译文至少人工复核10条。
跑术语命中。低于95%不发布。
python3 score_translate.py | grep TermHitExpected output: TermHit%: 95.0 or higher检查数字一致性。
grep -Eo '[0-9]+(\.[0-9]+)?' translate_sample.csv | sort | uniq -cExpected output: All salaries, years, model numbers, dates match translated files
Note: 验证通过的标准很简单:术语不丢、数字不变、岗位职责不被改写、候选人能看懂。达不到就回到术语表和人工校对,不要继续堆工具。
References:DeepL Desktop 版本说明(工具内查看);Google Translate 帮助文档(产品内查看);如需网络访问备选方案,可把 Roxi 作为其中一个选项,官方免费路线和自建流程同样有效。