职位详情
微信扫码分享
举报
1-3年本科Airflow爬虫pythonLinuxDocker数据抓取数据清洗Panda爬虫工程师
我们诚邀具备丰富经验的数据爬取与数据治理工程师加入大模型数据团队,共同打造高质量、结构化且合规的数据采集与治理体系,为大模型及智能应用提供坚实的数据基础。
岗位职责:
1、承担大模型训练所需网络数据的采集工作,涵盖文本、网页等多种内容类型;
2、构建高效、可扩展的网页解析系统与异步爬虫架构;
3、设计并落地数据清洗、内容筛选、质量评估等自动化治理流程;
4、协同模型研发、数据标注、运维等多部门推进数据闭环建设。
岗位要求:
1、本科及以上学历,具备两年以上数据爬虫与治理相关工作经验;
2、精通Python编程,具有扎实的系统设计与工程实现能力;
3、掌握主流爬虫工具(如Scrapy、Playwright、Selenium、Requests等)及分布式爬虫技术;
4、熟悉Linux环境下的开发与部署流程,了解常用容器化技术(如Docker);
5、熟练运用常见数据处理框架(如Pandas、Spark、Airflow等);
6、拥有百万级网页抓取经历或参与过大型数据治理项目者优先。
职位总结围绕职位描述,归纳工作内容、招聘要求

黄女士IP:广东广州
科奥信息
·人事经理广州
相同职位推荐
企业招聘

