统一表示学习」共找到 2051 篇相关文章

算法论文8

大模型如何泛化出多智能体推理能力?清华提出策略游戏自博弈方案MARSHAL

近日,清华大学等机构研究团队提出 MARSHAL 框架,利用强化学习让大模型在策略游戏自博弈。实验表明,多轮、多智能体训练提升了模型博弈决策水平,将推理能力泛化到通用多智能体系统,在一般推理任务表现显著提升。

机器之心
新闻资讯7

太初元碁乔梁:AI算法已经跑到单芯片极限|MEET2026

在量子位MEET2026智能未来大会上,太初元碁乔梁表示,当下AI算力需求指数级增长,超智融合成行业共识。单颗芯片性能成瓶颈,太初元碁设计PC link实现芯片互联,还分享了HPC+AI在多领域的落地实践。

量子位
新闻资讯7

苹果高级副总裁下岗!AI大败局,靠血洗AI团队解决?

刚进入12月,掌管苹果AI与机器学习战略七年的高级副总裁约翰·詹南德里亚卸任。苹果AI乏力非其一人之过,是谷歌流派与苹果文化冲突所致。此次人事调整后,AI回归软件工程本位,不过人才流失成新挑战。

新智元
开源动态8

让LLM不再话痨,快手HiPO框架来了

当前LLM存在‘过度思考’困境,效率与成本矛盾突出。快手与南大合作推出HiPO框架,通过混合数据冷启动和混合强化学习奖励系统,让模型能自主决策思考模式,实验显示它提升了效率和准确率,还具强泛化性。

机器之心
算法论文8

突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!

近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。

深度学习自然语言处理
新闻资讯7

DiT在数学和形式上是错的?谢赛宁回应:不要在脑子里做科学

X上有博主称DiT存在架构缺陷,其FID过早稳定,可能无法继续从数据中学习。还批判了DiT的设计,如使用后层归一化和adaLN - zero。DiT作者谢赛宁回应,强调做研究要基于实验,也指出DiT现存一些问题。

机器之心
产品应用7

AI 眼镜“秒变”直男程序员“脱单神器”,首次亮相被抢购一空!CEO 坦言:好产品要么能帮用户赚钱,要么能解决实际痛点

拂曦科技CEO段然分享AI眼镜创业经历。AI眼镜行业发展有趋势也有瓶颈,拂曦科技从B端转C端,其恋爱眼镜首秀被抢空。还谈到技术挑战、市场教育及未来爆款场景,强调场景是核心竞争力。

AI前线
产品应用8

4个月,创建20万个应用,这是背后的产品|对话百度秒哒

百度无代码应用搭建平台秒哒4个月创建20万个应用。量子位对话其负责人朱广翔,他表示AI时代创意至上,秒哒让创意落地,还介绍其多智能体协作、打通百度生态等思路,以及功能迭代和未来规划。

量子位
算法论文8

沉迷贪吃蛇,7B小模型竟变身「数学天才」!几何推理碾压GPT-4o

NVIDIA等团队提出视觉游戏学习ViGaL范式,让7B多模态模型玩贪吃蛇等游戏,使其在数学、几何等任务击败GPT - 4o。游戏培养通用认知与推理能力,不同游戏提升不同推理能力,多游戏训练效果更佳。

新智元
新闻资讯8

从「悟道」到「悟界」,智源走进大模型的新时代

在2025智源大会上,智源研究院院长王仲远表示大模型技术演进未到终点。会上推出「悟界」系列大模型,包含Emu3、见微Brainμ等,推动AI从数字走向物理世界。还介绍了具身智能成果,且与企业合作打造生态。

AI科技评论