岗位职责:
- 负责专业数据采集系统的设计、开发与维护,覆盖 API 接入、网页爬虫、动态页面及复杂数据源采集,并应对登录鉴权、验证码、访问限制、页面变化和复杂反爬机制。
- 负责文本、PDF 、Word 、Excel 、HTML 、图片等结构化及非结构化数据的解析、清洗、标准化、质量校验和入库,建设可复用的数据处理 Pipeline 。
- 负责多类型数据库的选型、设计、开发与性能优化,包括 PostgreSQL 、Elasticsearch 、Milvus 、Doris/ClickHouse 、Neo4j 等;基于 FastAPI 建设稳定、高效的数据服务 API 。
- 建设面向运营和市场投放的用户数据体系,完成 PostHog 埋点方案设计,并基于 Kafka 、Flink 等技术开发实时 ETL ,支撑用户行为分析和多维查询。
- 结合 LLM 与 BERT/Transformer 模型,从医学文献、临床试验报告、药品说明书及专利中提取疾病、药物、靶点、基因和不良反应等实体及关系,持续优化抽取准确率与召回率。
- 完成医学实体的标准化、实体链接、关系融合及质量校验,建设并持续更新基于 Neo4j 等技术的医学知识图谱,为上层 AI 应用提供知识服务。
- 主动与产品及业务团队协作,将模糊需求拆解为可落地的技术方案,独立完成设计、开发、测试、上线、监控及持续迭代,保障数据链路的稳定性、可维护性和可追溯性。
任职要求:
- 具备扎实的 Python 编程能力,能够独立完成数据采集、数据处理、数据库开发及服务化输出的全链路建设。
- 熟悉爬虫系统开发,具备处理登录鉴权、验证码、动态渲染、访问限制、反爬策略及数据源结构变化等问题的实战经验。
- 熟悉至少一种主流关系型数据库和至少一种 OLAP/MPP 数据库,具有实际生产环境中的开发、建模或性能优化经验。
- 熟悉 Elasticsearch 、Milvus 、Neo4j 中的至少两种,能够针对全文检索、向量检索和图关系查询等场景进行技术选型及优化。
- 具备实时流数据处理经验,实际使用过 Kafka 、Flink 、Spark Streaming 等相关技术。
- 具备基本的 LLM 应用开发经验,包括 Prompt Engineering 、模型 API 调用、开源模型部署等至少一种实践。
- 能够处理结构化和非结构化数据,具备 PDF 、Word 、Excel 、HTML 、图片等多格式数据的解析、清洗和标准化经验。
- 具备独立工程交付能力,能够完成从数据采集、处理、存储、查询到 API 服务化的完整闭环,而非仅停留在算法验证或接口调用层面。
加分项:
- 具有医学 NLP 、生物医药实体识别或医学知识图谱的生产级项目经验,熟悉疾病、药物、靶点等医学实体及相关术语体系。
- 具有 BERT/Transformer 模型微调、评估和生产部署经验,熟悉 ONNX 、Triton 或 TorchServe ;具有 PostHog 二次开发或完整埋点体系建设经验者优先。
- 具备 Docker 、Kubernetes 、CI/CD 及云原生部署实践。
公司文化:
- 务实的考核体系:结果导向,而非坐班导向:关注工作成果与业务价值,不以工作时长作为考核标准。
- 灵活办公模式:每周 2 天居家办公( Hybrid Working ),兼顾工作效率与生活平衡。
- 贴心通勤福利:提供上下班打车费用报销,让通勤更轻松、更高效。
- 开放、扁平、高效的团队文化:尊重专业、鼓励创新,为每一位成员提供充分发挥价值和持续成长的空间。