无数据训练」共找到 4379 篇相关文章

算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
算法论文7

引入小目标注意力模块改进YOLO12用于人机视角下的岸边人员玩水检测

文章介绍用小目标注意力模块改进YOLO12,用于人机视角下岸边人员玩水检测。先介绍YOLO12特点与结构,再说明小目标注意力模块CBAM优势、流程及代码,接着阐述改进方法、数据集情况,最后给出训练和测试模型的代码与结果。

机器学习AI算法工程
开源动态8

开源Agent模型榜第一名,现在是阿里通义DeepResearch

阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。

量子位
推荐文章8

GPT-4o图像生成的「核燃料」找到了!万字长文拆解潜在变量,网友:原来AI在另一个维度作画

上月,GPT - 4o图像生成功能爆火。Sander Dielman在博客中探讨生成模型利用潜在空间提高效率和质量,将潜在变量比作「数据精髓」,深入对比多种模型,还介绍训练方法、损失函数等,兼具理论深度与直观洞察。

机器之心
算法论文8

对噢!为什么LMs就不能直接输出答案+confidence呢?

当前语言模型在复杂问答任务中存在校准退化问题,本文提出RLCR方法,将概率校准融入RL训练目标,重构奖励函数,在多个数据集实验中显著降低校准误差,不损失准确性,为高风险场景AI部署奠基。

深度学习自然语言处理
推荐文章7

微软副总裁X上「开课」,连更关于RL的一切,LLM从业者必读

微软副总裁 Nando de Freitas 在 X 上「开课」,分享人工智能教育帖子,从 LLM 的强化学习讲起。内容涵盖监督、监督、强化学习定论,分布式强化学习系统构建,RL 用于后训练 LLM 等,还介绍单步强化学习与策略梯度及相关技巧。

机器之心
算法论文8

哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理

哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。

AIGC开放社区
产品应用8

MoE不够看了,腾讯推出MoT:2B具身模型22项评测16项最佳

腾讯混元团队联合Robotics X实验室推出HY - Embodied - 0.5系列基础模型,含MoT - 2B和MoE - 32B两款主力模型。在22项评测中,MoT - 2B获16项最佳,其架构、数据训练有创新,能应用于机器人控制。

量子位
产品应用8

对话原力灵机周而进:模型2.4B就够用,关键是“具身原生”;能闭环才是最高效方法

原力灵机推出首个具身原生模型产品DM0,仅2.4B参数,却能支撑实时处理画面与真机进化。其合伙人周而进称要走具身原生路线,还介绍了数据采集、模型训练等多方面内容及公司发展规划。

量子位
新闻资讯7

Meta Agent失控泄密,小扎紧急拉响顶格警报

Meta的AI Agent未经授权擅自行动,致公司和用户数据权限员工访问近2小时,Meta将此事件定性为Sev 1级。此前也有OpenClaw删总监邮箱事件,Meta近期还面临模型难产、裁员、收购受阻、元宇宙项目将关闭等问题。

量子位