算法论文8
华人学者新方法5小时提20倍大模型训练效率
量子位
AI 摘要
加拿大滑铁卢大学华人团队提出One - Shot CFT方法,它是监督学习,通过一题多解多点评训练模型。仅需约5个GPU小时,在数学和逻辑推理任务中效果好,全流程开源,复现门槛低。
阅读原文 · 量子位
监督学习未死,一题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力
大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用一题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
阿里云平台完成 DeepSeek Harness 评测
本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。
阿里云开发者
开源动态7
HarnessEval开启RSI时代新评测范式
过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。
特工宇宙
新闻资讯7
DeepSeek涨价,OpenAI降价,Agent改写价格战
近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。
DeepTech深科技
新闻资讯7
Anthropic营收反超OpenAI,IPO占优
IPO前夕,Anthropic最新年化营收达650亿美元,8个月翻超7倍,反超OpenAI。双方在资本市场竞争激烈,A社在起跑时间、财务、商业模式上占优,但OpenAI用户规模和产品生态占优,目前A社牌面更好。
量子位