AI速览:GPT-6指南、arXiv限流、训练提速
AI技术

AI速览:GPT-6指南、arXiv限流、训练提速

多奖励强化学习有个老毛病:让大模型同时满足多个目标时,各奖励的学习信号并不均衡。新论文提出 DARA,按每个批次里各奖励的活跃程度调权重——出现得少的奖励,权重给得更大,策略优化目标不动。工具调用和数学推理实验中,它达到指定合规水平所需训练步数比 GDPO 分别少 26% 和 65%,最终效果也没掉队。

OpenAI 在 10 月 2 日放出 GPT-6 系列使用指南,主题是怎么选模型、怎么优化提示词。说白了就是在时间和成本可控的前提下,把模型能力榨干净。对天天调 API 的团队来说,官方这份说明比第三方教程靠谱。

另一头,AI 生成的论文数量暴涨,审稿体系快撑不住了。arXiv 已经上线最严限流,投稿门槛明显收紧,研究者也开始摸索应对策略,比如调整投稿节奏、换发布渠道。审稿人不够、稿件无限,这个矛盾只会更突出。

三件事看着不挨着,其实都指向效率:训练端想用更少步数换同样效果,使用端想要指南少走弯路,学术端只能靠限流维持秩序。大模型跑得越快,配套的工具和规则就越得跟上。