「理论 - 实验学习范式」共找到 2540 篇相关文章
Adobe 新研究:不用再「喂」训练数据,VLM 靠和自己玩游戏变聪明
Adobe 等机构研究人员提出「Vision-Zero」,借鉴 AlphaGo 自迭代方式,设计让 VLM 自我学习框架。此框架以类似「谁是卧底」游戏训练,不依赖标注数据,在多任务超越有标注的 SOTA 方法。
灵巧手能帮女友拧瓶盖了!同济清华上海交大等新成果 | CoRL 2025
来自多高校研究团队提出KineDex框架,以真·手把手指导方式让人类动作传至灵巧手,同步采集高保真触觉信息,使星动纪元灵巧手星动XHAND 1解锁复杂精细操作,论文已被CoRL 2025接收。
听说,大家都在梭后训练?最佳指南来了
大模型时代,Scaling Law 边际效益递减,业界转向后训练。《Post-training 101》博客可助初学者入门,涵盖从预训练到指令微调、SFT 原理、多种强化学习技术及模型评测方法等内容。
1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒
QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升了Pass@k性能。它解决了RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。
给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集
随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。
她们估值840亿,刚发了第一个AI成果
估值超120亿美元的Thinking Machines发布首篇研究博客,由创始人、OpenAI前CTO Mira Murati宣发。研究聚焦克服大语言模型推理中的不确定性,探讨推理结果难复现的根源,还介绍解决办法并验证效果。
长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍
牛津大学团队提出VMem,把「看过什么」写进几何小片,用基于3D几何的记忆索引替代短窗上下文,实现「一致性更强、资源更省、速度更快」,实测速度比常规管线快约12倍。
别误会00后了!美国千人调查揭秘:85%学生都用AI,首要目的不是偷懒
国外机构调查1047名学生,结果显示约85%学生过去一年用生成式AI处理课程作业,主要用于头脑风暴、答疑与备考。学生希望学校规范AI使用,教师用AI教学学生看法不一,AI重塑大学价值评估体系。
DeepMind爆火论文:向量嵌入模型存在数学上限,Scaling laws放缓实锤?
DeepMind一篇关于向量嵌入局限性的论文在AlphaXiv爆火。其证明向量嵌入有数学上限,Scaling laws或放缓。研究构建LIMIT数据集,测试发现即便是先进嵌入模型也难解决简单任务,揭示了RAG系统约束,让人反思Scaling Laws边界。
两周干成一天!毕马威用100页Prompt落地企业Agent
毕马威打造税务AI助手TaxBot,将两周的专业咨询工作缩至一天,效率提升超10倍。其构建KPMG Workbench平台,集成多模型,用100页Prompt指导学习,未来或采用Agent Runtime服务。