一
算法工程师
岗位职责
- 负责把公司现有“原始数据集/业务数据”(文档、表格、系统字段、日志、对话、标注数据等)转化为可训练、可迭代的垂直领域训练集:清洗 → 结构化 → 标注/弱标注 → 指令化。
- 设计训练数据规范与口径:指令模板(单轮/多轮)、工具调用格式、结构化输出 schema(JSON/表格字段)、拒答与边界样本、难例与对比样本组织。
- 建立数据质量体系:去重(语义/指纹)、噪声过滤、敏感信息处理(脱敏/合规)、分布统计、覆盖率分析;输出可量化的数据质量报告与改进建议。
- 组织标注与审核流程(可协同业务/运营/专家):制定标注指南、抽检规则、一致性评估;把“人类经验”沉淀为可执行的规范。
- 利用模型辅助提效但不盲信:用 LLM 做数据改写/扩写/合成、自动初标、难例挖掘;同时建立人工复核与对齐规则,保证训练数据可信。
- 与微调工程师协作:根据训练/评测反馈快速迭代数据(补盲区、补难例、修模板、调配比),把效果提升“落到数据上”。
- 建立数据与训练集资产管理:版本化、可追溯、可回滚(数据集卡片、变更记录、抽样集、评测集/对照集)。
任职要求
- 本科及以上;2-5 年数据处理/NLP/算法工程经验,做过“从原始数据到可训练数据”的完整闭环优先。
- 数据与工程能力(约占能力结构 70%)
- 熟练 Python(pandas/pyarrow/regex/json)、SQL,能写稳定 ETL/清洗/抽样脚本。
- 熟悉文本处理与质量控制:分句、token 长度控制、重复与近重复、异常检测、分布统计。
- 有数据版本管理与规范意识(命名、目录、元数据、变更记录、可复现)。
- LLM 训练数据理解(约占能力结构 30%)
- 理解指令微调数据的关键:任务定义、输入输出边界、格式约束、多轮一致性、领域术语与事实性。
- 能设计评测/回归数据:覆盖核心任务、边界案例、难例集、对照组。
- 了解常见对齐问题与数据应对:幻觉抑制、拒答策略、风格统一、工具调用约束。
- 沟通与抽象能力:能把业务专家的“口头规则”提炼成可训练的 schema、标签体系与样本规则;能推动跨部门协作产出数据。
加分项
- 有数据标注体系/质检体系建设经验,或熟悉主流标注工具与流程。
- 做过知识库/知识图谱/企业字段体系的整理(能把“业务语言”变成“数据语言”)。
- 熟悉多模态数据(图片/视频/音频)与 LLM 训练数据的组织方式(若公司后续扩展)。
- 有行业数据合规/脱敏实践经验(审计留痕、权限分级、敏感字段策略)。