数据开发
数据开发Hadoop
深圳远至信息科技有限公司北京·丰台区·北大地
AI数据工程师
2.5-3.5万/月发送简历
聊一聊
职位详情:
不合适
投诉
经验不限本科数据治理经验数据平台开发经验其他数据开发经验PythonSQL数据开发
我们在寻找职业早期到中早期的高潜 Data Builder:强烈想把外部世界整理成 Agent 能理解、能引用、能追溯、能持续进化的数据资产。
岗位亮点
● 直接参与 AI First 数据底座建设,把新闻、公告、企业、产业链、报告、人物、机构、事件等信息组织成可消费的数据资产。
● 你会决定哪些事实值得进入系统、怎样建模、怎样抓取、怎样评测、怎样进入 Agent 和报告链路。
● 这里看重信息结构感、研究品味、schema 审美、自动化欲望和证据敏感度。
● 小团队核心位置,优秀 Data Builder 会直接提升 Agent 的认知边界和产品可信度。
你会承担的战场
● 建立数据地图:识别高价值数据源、更新频率、采集优先级、实体边界、事件边界和关系边界。
● 设计 schema:让数据同时适合存储、检索、引用、报告生成、评测和 Agent tool calling。
● 设计采集策略:增量抓取、去重、回填、异常重试、来源可信度、质量检查和证据链。
● 将半结构化网页、公告、新闻、报告和开放资料转化为稳定的数据产品。
● 与 Agent 协作完成数据源研究、字段设计、样例生成、爬虫实现、质量诊断和文档沉淀。
● 把数据从 raw source 推进到 structured facts、citation、Agent context、benchmark 和产品体验。
我们寻找的灵魂画像
● 有强烈信息结构欲,看到网页、公告、新闻或报告,会自然拆出事实单元、实体关系和长期价值。
● 有高密度学习能力,能快速进入陌生行业,理解业务语言,再抽象成稳定的数据模型。
● 有主动性,面对数据空白会自己找来源、定 schema、做样例、跑验证、推动进入产品链路。
● 有 AI 原生工作习惯,能用 Agent 做数据源调研、schema 草图、抓取脚本、质量检查和复盘。
● 有证据敏感度,关心来源、引用、时间、可信度、覆盖率、更新频率和数据漂移。
● 有韧性,能在脏数据、反爬、字段变化、质量波动和业务反馈中持续推进。
基础能力
● 能写扎实脚本或数据代码,Python / SQL / TypeScript 任一方向具备一项强项即可。
● 理解数据库、schema、ETL、爬虫、API、队列、去重、增量同步、测试和数据质量基本功。
● 理解 LLM、RAG、tool calling、citation、eval、Agent context 的核心概念,并愿意持续深入。
● 有个人数据项目、爬虫项目、研究报告、开源贡献、自动化工具或能展示信息结构感的作品。
加分信号
● 做过企业数据、产业链数据、新闻数据、公告数据、金融数据、知识图谱、搜索或数据产品。
● 有 PostgreSQL、SQLAlchemy、Redis、向量检索、数据评测、数据治理或 schema migration 经验。
● 经常使用 Cursor、Codex、Claude Code、ChatGPT 等 AI 工具,并形成自己的数据工作流。
福利与成长
● AI First 一线产品机会,接触大模型应用从原型到生产的完整过程。
● 高密度数据与产品挑战,成长速度和责任边界同步提升。
● 小团队核心岗位,沟通链路短,个人影响力直接进入产品和系统。
● 薪资与级别按能力匹配,核心人才提供有竞争力待遇。
职位总结围绕职位描述,归纳工作内容、招聘要求

唐女士IP:北京
1个月内活跃|
北京本征逻辑科技有限公司
·人事经理工作地址:
北京海淀区清华科技园·创业大厦
点击查看地图法定代表人:葛婷婷
成立日期:2026-02-03
