
AI MLOps 与 LLMOps 工程师
将多语言 NLP 和 LLM 能力投入生产环境中的 AI 系统。 构建 AWS 数据管道、混合搜索、模型部署工作流和大规模文档处理解决方案。
描述
- 集成并优化用于文档分类、实体提取、去标识化和基于 LLM 的趋势检测的推理管道。
- 通过运行在 AWS EKS 上的 Airflow DAG,将数据科学模块连接到端到端生产工作流。
- 使用 GTE 多语言稠密嵌入和 Aurora PostgreSQL 上的 GIN 词法索引,开发并优化混合搜索。
- 集成基于 OpenAI 的 API 平台,用于多语言查询扩展和由 LLM 驱动的趋势检测。
- 设计并维护预处理管道,处理存储在 S3 和 DataLake 系统中的嵌套 JSON、电子邮件附件和内嵌 PDF。
- 处理涵盖 300 GB 理赔记录和文档的多语言非结构化文本。
- 开发分块方法和元数据提取流程,用于嵌入和检索工作流。
- 创建并维护用于月度实体刷新、趋势检测和去标识化批处理的 Airflow DAG。
- 编排 AWS S3、Athena、Glue、Fargate、SQS 和 Step Functions 之间的数据移动。
- 扩展处理系统,以支持超过 500,000 份理赔记录和数亿个文本块。
- 使用 MLflow 和 Databricks 部署机器学习模型并管理其版本。
- 使用 Aurora PostgreSQL 上的 Liquibase 管理架构变更和数据库迁移。
- 为生产管道添加日志记录、监控和检索质量评估评分。
任职要求
- 计算机科学、信息技术、数据科学、人工智能、统计学、数学或相关专业本科及以上学历。
- 数据科学、人工智能/机器学习、计算机科学或分析学硕士学位优先,但非必需。
- 拥有云计算或数据工程认证者优先。
- 精通 Python(主要编程语言)和 SQL。
- 具备集成 LLM API,以及使用多语言嵌入、混合搜索、文本分类、实体提取、命名实体识别和个人身份信息脱敏的经验。
- 具备 Apache Airflow、批处理编排和大规模非结构化数据处理经验。
- 具备 AWS 服务的实际经验,包括 S3、Athena、Glue、Fargate、EKS、SQS 和 Step Functions。
- 了解 PostgreSQL 或 Aurora、pgvector、GIN 索引和全文搜索。
- 具备使用 MLflow 和 Databricks 或 Azure Databricks 的经验。
- 具备基于 GitHub 的开发、CI/CD、架构管理和生产支持经验。









