GoForum🌐 V2EX

[招聘] 生物医药 AI 公司|数据平台工程师 |25~ 40K|上海 |

joywho · 2026-08-11 22:42 · 0 次点赞 · 2 条回复

岗位职责:

  1. 负责专业数据采集系统的设计、开发与维护,覆盖 API 接入、网页爬虫、动态页面及复杂数据源采集,并应对登录鉴权、验证码、访问限制、页面变化和复杂反爬机制。
  2. 负责文本、PDF 、Word 、Excel 、HTML 、图片等结构化及非结构化数据的解析、清洗、标准化、质量校验和入库,建设可复用的数据处理 Pipeline 。
  3. 负责多类型数据库的选型、设计、开发与性能优化,包括 PostgreSQL 、Elasticsearch 、Milvus 、Doris/ClickHouse 、Neo4j 等;基于 FastAPI 建设稳定、高效的数据服务 API 。
  4. 建设面向运营和市场投放的用户数据体系,完成 PostHog 埋点方案设计,并基于 Kafka 、Flink 等技术开发实时 ETL ,支撑用户行为分析和多维查询。
  5. 结合 LLM 与 BERT/Transformer 模型,从医学文献、临床试验报告、药品说明书及专利中提取疾病、药物、靶点、基因和不良反应等实体及关系,持续优化抽取准确率与召回率。
  6. 完成医学实体的标准化、实体链接、关系融合及质量校验,建设并持续更新基于 Neo4j 等技术的医学知识图谱,为上层 AI 应用提供知识服务。
  7. 主动与产品及业务团队协作,将模糊需求拆解为可落地的技术方案,独立完成设计、开发、测试、上线、监控及持续迭代,保障数据链路的稳定性、可维护性和可追溯性。

任职要求:

  1. 具备扎实的 Python 编程能力,能够独立完成数据采集、数据处理、数据库开发及服务化输出的全链路建设。
  2. 熟悉爬虫系统开发,具备处理登录鉴权、验证码、动态渲染、访问限制、反爬策略及数据源结构变化等问题的实战经验。
  3. 熟悉至少一种主流关系型数据库和至少一种 OLAP/MPP 数据库,具有实际生产环境中的开发、建模或性能优化经验。
  4. 熟悉 Elasticsearch 、Milvus 、Neo4j 中的至少两种,能够针对全文检索、向量检索和图关系查询等场景进行技术选型及优化。
  5. 具备实时流数据处理经验,实际使用过 Kafka 、Flink 、Spark Streaming 等相关技术。
  6. 具备基本的 LLM 应用开发经验,包括 Prompt Engineering 、模型 API 调用、开源模型部署等至少一种实践。
  7. 能够处理结构化和非结构化数据,具备 PDF 、Word 、Excel 、HTML 、图片等多格式数据的解析、清洗和标准化经验。
  8. 具备独立工程交付能力,能够完成从数据采集、处理、存储、查询到 API 服务化的完整闭环,而非仅停留在算法验证或接口调用层面。

加分项:

  1. 具有医学 NLP 、生物医药实体识别或医学知识图谱的生产级项目经验,熟悉疾病、药物、靶点等医学实体及相关术语体系。
  2. 具有 BERT/Transformer 模型微调、评估和生产部署经验,熟悉 ONNX 、Triton 或 TorchServe ;具有 PostHog 二次开发或完整埋点体系建设经验者优先。
  3. 具备 Docker 、Kubernetes 、CI/CD 及云原生部署实践。

公司文化:

  1. 务实的考核体系:结果导向,而非坐班导向:关注工作成果与业务价值,不以工作时长作为考核标准。
  2. 灵活办公模式:每周 2 天居家办公( Hybrid Working ),兼顾工作效率与生活平衡。
  3. 贴心通勤福利:提供上下班打车费用报销,让通勤更轻松、更高效。
  4. 开放、扁平、高效的团队文化:尊重专业、鼓励创新,为每一位成员提供充分发挥价值和持续成长的空间。

工作地点:上海

简历投递: joy_ss@foxmail.com

2 条回复
shunia · 2026-08-11 22:42
#1

不太懂这个领域,感觉这工作感觉难度高的很,一个人根本干不完。工资似乎不够匹配啊?

joywho · 2026-08-11 22:42
#2

@shunia 肯定不是一个人呀,目前暂时有三个工程师在做同类型的活

添加回复
你还需要 登录 后发表回复

登录后可发帖和回复

登录 注册
主题信息
作者: joywho
发布: 2026-08-11
点赞: 0
回复: 0