一
算法工程師
崗位職責
- 負責把公司現有“原始數據集/業務數據”(文檔、表格、系統字段、日誌、對話、標註數據等)轉化為可訓練、可迭代的垂直領域訓練集:清洗 → 結構化 → 標註/弱標註 → 指令化。
- 設計訓練數據規範與口徑:指令模板(單輪/多輪)、工具調用格式、結構化輸出 schema(JSON/表格字段)、拒答與邊界樣本、難例與對比樣本組織。
- 建立數據質量體系:去重(語義/指紋)、噪聲過濾、敏感信息處理(脫敏/合規)、分佈統計、覆蓋率分析;輸出可量化的數據質量報告與改進建議。
- 組織標註與審核流程(可協同業務/運營/專家):制定標註指南、抽檢規則、一致性評估;把“人類經驗”沉澱為可執行的規範。
- 利用模型輔助提效但不盲信:用 LLM 做數據改寫/擴寫/合成、自動初標、難例挖掘;同時建立人工複核與對齊規則,保證訓練數據可信。
- 與微調工程師協作:根據訓練/評測反饋快速迭代數據(補盲區、補難例、修模板、調配比),把效果提升“落到數據上”。
- 建立數據與訓練集資產管理:版本化、可追溯、可回滾(數據集卡片、變更記錄、抽樣集、評測集/對照集)。
任職要求
- 本科及以上;2-5 年數據處理/NLP/算法工程經驗,做過“從原始數據到可訓練數據”的完整閉環優先。
- 數據與工程能力(約佔能力結構 70%)
- 熟練 Python(pandas/pyarrow/regex/json)、SQL,能寫穩定 ETL/清洗/抽樣腳本。
- 熟悉文本處理與質量控制:分句、token 長度控制、重複與近重複、異常檢測、分佈統計。
- 有數據版本管理與規範意識(命名、目錄、元數據、變更記錄、可復現)。
- LLM 訓練數據理解(約佔能力結構 30%)
- 理解指令微調數據的關鍵:任務定義、輸入輸出邊界、格式約束、多輪一致性、領域術語與事實性。
- 能設計評測/迴歸數據:覆蓋核心任務、邊界案例、難例集、對照組。
- 瞭解常見對齊問題與數據應對:幻覺抑制、拒答策略、風格統一、工具調用約束。
- 溝通與抽象能力:能把業務專家的“口頭規則”提煉成可訓練的 schema、標籤體系與樣本規則;能推動跨部門協作產出數據。
加分項
- 有數據標註體系/質檢體系建設經驗,或熟悉主流標註工具與流程。
- 做過知識庫/知識圖譜/企業字段體系的整理(能把“業務語言”變成“數據語言”)。
- 熟悉多模態數據(圖片/視頻/音頻)與 LLM 訓練數據的組織方式(若公司後續擴展)。
- 有行業數據合規/脫敏實踐經驗(審計留痕、權限分級、敏感字段策略)。