近日,腾讯混元团队分离中国人民年夜教高瓴人工智能教院等机构,共同推出并开源了 PlanningBench。那是一个旨正在评测和锻炼年夜语止模子规划才气的可扩展、可考据的数据生成框架。


PlanningBench 从理想的规划场景解缆,系统化地笼统了任务、约束和难度等果素,构建了一个笼盖逾越 30 种规划任务类型的数据生成取考据系统。那一框架不但能够评测模子可否具备规划才气,还可认为模子的规划才气锻炼供给波动且可迁移的奖励疑号。

正在详细任务方面,PlanningBench 涵盖了日程排布、整天职配、人力排班、途径调理、消费运营和应急办事等六年夜类任务。何等普遍的任务类型设念,制止了模子仅正在单一规模的 “刷题” 现象,使得模子能够更好地应对多样化的理想利用场景。
别的,PlanningBench 的难度控制系统经由过程拆解任务机关、约束层级和本钱宽峻度等果素,使得数据生成能够环绕实正在难点截至调解,而不是简单延长提醉内容。每条数据实例还配备了 checklist,用以评价模子输出可否满足输入前提、本钱限制和目的最劣性。
值得一提的是,PlanningBench 同时关注部门合规和全局胜利的评测格式,能够识别出 “看似年夜部门精确但整体不成施止” 的计划。那关于诊断年夜型语止模子正在复纯约束下的实正在规划才气具有重要意义。
经由过程 PlanningBench 的可考据数据截至锻炼,模子正在已见过的规划基准和通用任务上的暗示也有了隐著汲引,隐现出其进建疑号的通用性。总体来看,PlanningBench 构成了一个实正在场景驱动的闭环生成取锻炼迁移系统,为将来的人工智能规划研讨供给了新的工具和标的目的。
划重点:
PlanningBench 是腾讯取人年夜高瓴分离开发的开源框架,旨正在评测和锻炼年夜语止模子的规划才气。
该框架笼盖 30 多种规划任务类型,涉及日程排布、整天职配等六年夜类理想利用。
经由过程可考据数据截至锻炼,模子正在差异任务上的暗示隐著汲引,展示了其普遍的合用性和迁移才气。
