人工智能产品评估课程,面向工程师和PM,讲解构建评估流程
我们正在为工程师和技术PM开设一门关于AI产品评估的课程!为什么?
尽管市面上有很多工具,但关于如何构建评估的*教育*却很少——比如,从模糊的想法到部署产品的实际过程是什么?你怎么知道你的系统好不好?“好”到底是什么意思?应该遵循什么流程?
过去几年里,我写了(也看别人写了)成千上万的提示,调试了智能体失败,制作了自定义指标,大规模对LLM输出进行vibe检查,构建了错误分析仪表盘……那些对我及合作者有效的方法,并没有在任何地方被教授。如何为你的评估引导数据和标签?如何将定性分析与定量指标评估(如LLM作为评判者)结合起来?如何构建良好的界面来获取人类反馈(从上下点赞到开放反馈的努力层次)?如何协调*多个*合作者与LLM作为评判者?如何在调用更重的提示优化之前,利用LLM辅助编写提示或任务规范?有哪些有用的可视化方法可以帮助理解多智能体系统性能以及需要调试的组件?
我非常兴奋能与@HamelHusain合作教授上述内容!课程与工具无关、动手实践、无花哨。课程将包括讲座、练习、办公时间、真实案例研究以及一些精彩的客座讲座:-)
最后,为什么是这个价格?我们希望专注于那些认真构建的学生。但如果你确实认真且价格阻碍了你,可以私信我了解其他选项。
在此注册(35%折扣链接):
https://maven.com/parlance-labs/evals?promoCode=hamel-ns4591
尽管市面上有很多工具,但关于如何构建评估的*教育*却很少——比如,从模糊的想法到部署产品的实际过程是什么?你怎么知道你的系统好不好?“好”到底是什么意思?应该遵循什么流程?
过去几年里,我写了(也看别人写了)成千上万的提示,调试了智能体失败,制作了自定义指标,大规模对LLM输出进行vibe检查,构建了错误分析仪表盘……那些对我及合作者有效的方法,并没有在任何地方被教授。如何为你的评估引导数据和标签?如何将定性分析与定量指标评估(如LLM作为评判者)结合起来?如何构建良好的界面来获取人类反馈(从上下点赞到开放反馈的努力层次)?如何协调*多个*合作者与LLM作为评判者?如何在调用更重的提示优化之前,利用LLM辅助编写提示或任务规范?有哪些有用的可视化方法可以帮助理解多智能体系统性能以及需要调试的组件?
我非常兴奋能与@HamelHusain合作教授上述内容!课程与工具无关、动手实践、无花哨。课程将包括讲座、练习、办公时间、真实案例研究以及一些精彩的客座讲座:-)
最后,为什么是这个价格?我们希望专注于那些认真构建的学生。但如果你确实认真且价格阻碍了你,可以私信我了解其他选项。
在此注册(35%折扣链接):
https://maven.com/parlance-labs/evals?promoCode=hamel-ns4591
https://t.co/oeLyTLvngU