1-3年本科GAIASWE-BenchHumanEvalPython
● 计算机科学、软件工程或人工智能等相关专业背景。
● 精通 Python 与 JavaScript,具备扎实的编程功底和工程实践能力,能独立完成技术问题的分析与解决。
● 掌握主流模型评测数据集(HumanEval、SWE-Bench、τ²-Bench、GAIA 等)的应用场景与使用方法。
● 熟悉模型评估指标的设计逻辑及结果分析方式(如准确率、通过率、BLEU、******、代码执行率等)。
● 具备较强的数据分析意识,能够依据数据表现提炼有效结论并指导优化方向。
● 拥有良好的技术文档编写能力,可清晰展示模型能力的发展与演进趋势。
职位总结围绕职位描述,归纳工作内容、招聘要求
招聘人数1-2人
薪资报酬1.5-1.7万元/月
招聘有效期职位27天内有效
工作地点北京海淀区万家灯火大厦1号楼1单元
核心工作内容:
负责大模型性能评估体系设计与实施,运用HumanEval、SWE-Bench等数据集进行模型测试与结果分析;跟踪评估指标(准确率、代码执行率等)变化趋势,撰写专业评估报告;协同研发团队定位模型缺陷,提出优化建议;持续更新评测方法论,确保评估结果科学可靠,支撑模型迭代升级。
岗位基本条件:
计算机科学、软件工程或人工智能等相关专业背景。精通 Python 与 JavaScript,具备扎实的编程功底和工程实践能力,能独立完成技术问题的分析与解决。掌握主流模型评测数据集(HumanEval、SWE-Bench、τ²-Bench、GAIA 等)的应用场景与使用方法。熟悉模型评估指标的设计逻辑及结果分析方式(如准确率、通过率、BLEU、******、代码执行率等)。具备较强的数据分析意识,能够依据数据表现提炼有效结论并指导优化方向。拥有良好的技术文档编写能力,可清晰展示模型能力的发展与演进趋势。