职位详情
微信扫码分享
举报
1-3年大专大模型评测大模型算法JavaScriptPython大模型评测体系开发测评工具开发入职五险一金一年两次调薪
工作内容
1、参与快手基础大模型及 Agent 应用评估体系的构建与持续优化,建立高水平的评测机制,支撑大模型技术迭代升级;
2、参与评测数据集与 BenchMark 的设计与完善,搭建评测环境,开发评测工具,实现评测报告自动化生成,全面提升评测流程效率;
任职要求
● 计算机科学、软件工程或人工智能等相关专业背景。
● 精通 Python 和 JavaScript,具备扎实的编程功底和工程实践能力,能独立完成技术问题分析与解决。
● 了解主流模型评估数据集(HumanEval、SWE-Bench、τ²-Bench、GAIA 等)。
● 掌握模型评估指标的设计逻辑与结果分析方法(准确率、通过率、BLEU、******、代码执行率等)。
● 具备较强的数据分析意识,能够依据评测数据输出有效结论。
● 具备良好的技术文档编写能力,可清晰展示模型能力的发展变化趋势。
职位总结围绕职位描述,归纳工作内容、招聘要求

王女士IP:北京
联想利泰
·人事经理海淀区
相同职位推荐
企业招聘
职位大全
相关搜索

