不对称训练」共找到 3320 篇相关文章

算法论文8

爆火论文颠覆RL认知!「错误奖励」让LLM推理暴涨24.6%,学界惊了

最新爆火论文颠覆传统RL训练认知,华盛顿大学等团队证实「伪奖励」可让LLM推理性能提升。研究设置多种伪奖励形式实验,发现其对Qwen模型有效,但并非对所有模型都有效。

新智元
推荐文章7

大模型微调知识与实践分享

文章详细介绍大型语言模型(LLM)微调知识与实践,包括模型结构、参数量等知识,以及Prompt工程、数据构造、LoRA微调等技术点。还给出微调实践流程,介绍相关平台和框架,如星云、TuningFactory等。

阿里云开发者
产品应用8

字节跳动2步突破,复杂文档布局解析,为啥如此惊艳?

文章指出现有文档图像解析方案有局限,介绍字节跳动的Dolphin解决方案。它采用分析 - 解析范式分两阶段解析文档,避免传统方法弊端,运行效率高,还给出训练方案、实战代码和试用链接。

CourseAI
新闻资讯8

甲小姐对话柳钢:AI编程商业化的中国解法 | 甲子光年

AI编程赛道发展火热但商业化难题凸显,国内外市场境遇同。极狐GitLab CEO柳钢将困境转化为突破口,推出驭码CodeRider。他认为用AI赚钱时代已到,还分享对产品、商业、开源等方面的看法。

甲子光年
新闻资讯8

万字实录:VLA 范式,具身智能的曙光与迷雾丨GAIR Live

2025年5月9日,雷峰网等举办“具身智能之VLA的实践与突破”线上圆桌沙龙。多位专家探讨VLA定义、起源、技术路线等,指出其面临推理、数据等瓶颈,还讨论了与强化学习结合、数据选择、提升泛化性、长程任务及落地场景等问题。

AI科技评论
推荐文章7

RAG系统设计:揭秘语义搜索被低估的核心价值与KG驱动的架构选型策略

在AICon大会上,Hugging Face的尹一峰探讨基于语义搜索的RAG系统重要性,揭示其被低估原因,分析本质与作用,分享设计高效架构方法,还讨论KG驱动的RAG系统及范式选择。

AI前线
开源动态8

AI开始玩乐高了?我拼一小时的乐高,它几秒就搭好,LegoGPT开源了!

卡内基梅隆大学提出LegoGPT,是首个依文本提示生成物理稳定乐高积木模型的方法。构建了StableText2Lego数据集,训练自回归大模型生成设计,还开发纹理生成法,设计能手动或机器人组装。

带你学AI
推荐文章8

来吧,往死理卷,9.8K Star TypeWords~~~

本文推荐Star量9.8K的开源背词项目TypeWords,针对「眼熟单词写出」的痛点,设计了无提示输出的练习闭环,面向技术人给出使用指南,同时说明其本地存储特性与同步限制。

小华同学ai
开源动态8

全球首个!10万小时人类数据全开源,Hugging Face罕见站台

上周Dyna Robotics公司用超100万小时人类第一视角视频训练DYNA - 2模型,发现物理AI有Scaling Law。8月20日光轮智能宣布10万小时全模态人类行为数据EgoSuite - Open100K开源,与Hugging Face联合发布。

新智元
新闻资讯7

撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍

J - Space Cognition Suite社区项目在X上传播,称修改DeepSeek V4 - Pro模型权重,用推理时Harness能提升其在多项Agent Benchmark表现,超Fable 5,但未第三方复现,且Token开销可能翻倍。

InfoQ