• 外包信息请发到 /go/outsourcing 节点。
• 不要把相同的信息发到不同的节点
joywho
V2EX  ›  酷工作

[招聘] 生物医药 AI 公司|数据平台工程师 |25~ 40K|上海 |

  •  
  •   joywho · 15h 25m ago · 859 views

    岗位职责:

    1. 负责专业数据采集系统的设计、开发与维护,覆盖 API 接入、网页爬虫、动态页面及复杂数据源采集,并应对登录鉴权、验证码、访问限制、页面变化和复杂反爬机制。
    2. 负责文本、PDF 、Word 、Excel 、HTML 、图片等结构化及非结构化数据的解析、清洗、标准化、质量校验和入库,建设可复用的数据处理 Pipeline 。
    3. 负责多类型数据库的选型、设计、开发与性能优化,包括 PostgreSQL 、Elasticsearch 、Milvus 、Doris/ClickHouse 、Neo4j 等;基于 FastAPI 建设稳定、高效的数据服务 API 。
    4. 建设面向运营和市场投放的用户数据体系,完成 PostHog 埋点方案设计,并基于 Kafka 、Flink 等技术开发实时 ETL ,支撑用户行为分析和多维查询。
    5. 结合 LLM 与 BERT/Transformer 模型,从医学文献、临床试验报告、药品说明书及专利中提取疾病、药物、靶点、基因和不良反应等实体及关系,持续优化抽取准确率与召回率。
    6. 完成医学实体的标准化、实体链接、关系融合及质量校验,建设并持续更新基于 Neo4j 等技术的医学知识图谱,为上层 AI 应用提供知识服务。
    7. 主动与产品及业务团队协作,将模糊需求拆解为可落地的技术方案,独立完成设计、开发、测试、上线、监控及持续迭代,保障数据链路的稳定性、可维护性和可追溯性。

    任职要求:

    1. 具备扎实的 Python 编程能力,能够独立完成数据采集、数据处理、数据库开发及服务化输出的全链路建设。
    2. 熟悉爬虫系统开发,具备处理登录鉴权、验证码、动态渲染、访问限制、反爬策略及数据源结构变化等问题的实战经验。
    3. 熟悉至少一种主流关系型数据库和至少一种 OLAP/MPP 数据库,具有实际生产环境中的开发、建模或性能优化经验。
    4. 熟悉 Elasticsearch 、Milvus 、Neo4j 中的至少两种,能够针对全文检索、向量检索和图关系查询等场景进行技术选型及优化。
    5. 具备实时流数据处理经验,实际使用过 Kafka 、Flink 、Spark Streaming 等相关技术。
    6. 具备基本的 LLM 应用开发经验,包括 Prompt Engineering 、模型 API 调用、开源模型部署等至少一种实践。
    7. 能够处理结构化和非结构化数据,具备 PDF 、Word 、Excel 、HTML 、图片等多格式数据的解析、清洗和标准化经验。
    8. 具备独立工程交付能力,能够完成从数据采集、处理、存储、查询到 API 服务化的完整闭环,而非仅停留在算法验证或接口调用层面。

    加分项:

    1. 具有医学 NLP 、生物医药实体识别或医学知识图谱的生产级项目经验,熟悉疾病、药物、靶点等医学实体及相关术语体系。
    2. 具有 BERT/Transformer 模型微调、评估和生产部署经验,熟悉 ONNX 、Triton 或 TorchServe ;具有 PostHog 二次开发或完整埋点体系建设经验者优先。
    3. 具备 Docker 、Kubernetes 、CI/CD 及云原生部署实践。

    公司文化:

    1. 务实的考核体系:结果导向,而非坐班导向:关注工作成果与业务价值,不以工作时长作为考核标准。
    2. 灵活办公模式:每周 2 天居家办公( Hybrid Working ),兼顾工作效率与生活平衡。
    3. 贴心通勤福利:提供上下班打车费用报销,让通勤更轻松、更高效。
    4. 开放、扁平、高效的团队文化:尊重专业、鼓励创新,为每一位成员提供充分发挥价值和持续成长的空间。

    工作地点:上海

    简历投递: [email protected]

    7 replies    2026-08-12 12:49:42 +08:00
    shunia
        1
    shunia  
       15h 20m ago via Android
    不太懂这个领域,感觉这工作感觉难度高的很,一个人根本干不完。工资似乎不够匹配啊?
    joywho
        2
    joywho  
    OP
       15h 16m ago
    @shunia 肯定不是一个人呀,目前暂时有三个工程师在做同类型的活
    yingxiangyu
        3
    yingxiangyu  
       11h 3m ago
    各项很符合,要是能远程就好了,不想去坐班了
    chi1st
        4
    chi1st  
       4h 32m ago
    目前正在做类似的事情,可惜地理位置不太合适
    Clannad0708
        5
    Clannad0708  
       3h 23m ago
    哈喽是外企吗?
    blog.mumong.cn 这是我自己 vibe 的一个人网站,里面有我的相关介绍您看看符合不。
    熟悉云原生背景,熟练使用 ai coding 能力,做过非结构化 pdf ,word ,html 的解析,可以看看合适不。
    wupeaking
        6
    wupeaking  
       2h 54m ago
    @joywho 大佬,Python 是必须项吗? 做 Go 的可以吗?
    irvinghua
        7
    irvinghua  
       1h 8m ago
    这个工作感觉我很胜任,但我人不在上海。

    我干过医疗领域里的爬虫编写、非结构化数据解析、清洗,也用过 neo4j 、PostgreSQL 、ClickHouse 、doris ,更做过 BERT 模型微调来进行生物医药实体识别,甚至还做过埋点。
    但是这是我 6 年前的工作经验,AI 大模型出来后,感觉这套技术框架完全落后了。我后面调到其他项目组去了,就没有关注和继续架构升级了。
    我比较好奇的是,现在大模型这么厉害了,为啥还要 bert 模型进行 fine tune ?我当年做 bert fine tune 是苦于 gpt-3.5 等大模型还没问世。到 2026 了,本地部署一套国产大模型如 deepseek ,或者网络允许的话,使用在线顶尖大模型,它的实体识别的召回率,比你们 bert fine tune 的效果还要差很多吗?
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5236 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 41ms · UTC 05:58 · PVG 13:58 · LAX 22:58 · JFK 01:58
    ♥ Do have faith in what you're doing.