神经网络训练」共找到 2199 篇相关文章

新闻资讯8

惊天大瓜!中东土豪发「纯血」大模型,背后底座竟是MiniMax?

沙特发布号称100%沙特血统的国家级大模型HUMAIN M3,后被发现基于中国MiniMax的M3模型。沙特用超1万亿阿拉伯语Tokens后训练,使模型在阿拉伯语赛道领先,代表中国AI出海新形态。

新智元
新闻资讯7

拒掉字节、谷歌橄榄枝,Meta 离职大佬田渊栋官宣自立门户!苏妈老黄追着投

Meta离职大佬田渊栋官宣创业,新公司Recursive Superintelligence首轮融资6.5亿美元,估值46.5亿美元。其团队豪华,想跳出大模型竞争老路,让AI具备自我进化能力,计划2026年中期推出自主训练系统。

InfoQ
算法论文8

Kimi新架构让马斯克叹服!17岁高中生作者一战成名

17岁高中生陈广宇作为共同一作的论文提出Attention Residuals技术,将注意力机制“旋转90度”。该技术可让模型“回头看”,经Kimi Linear 48B大模型验证,训练效率提升25%,推理延迟增加不到2%。

量子位
算法论文8

LLM-in-Sandbox:给大模型一台电脑,激发通用智能体能力

来自中国人民大学、微软研究院和清华的研究者提出LLM - in - Sandbox范式,让大模型在代码沙盒完成任务,实验显示其能提升多领域表现,无需额外训练,还能减少token消耗,研究者认为应取代纯LLM推理。

机器之心
算法论文8

无需奖励函数!我们意外构建了自我进化的AI系统

牛津大学发现LLM可通过“部署 - 验证 - 再训练”循环自我进化,绕开人工奖励函数设计瓶颈。在三个经典规划领域实验效果惊人,还在理论上证明其与强化学习的数学等价关系,有优势也有隐患。

AI工程化
开源动态8

LeCun预言成真!790年长视频,炼出最强开源「世界模型」

2025年‘世界模型’成AI巨头战场,谷歌、李飞飞团队等纷纷布局。上周北京智源研究院发布Emu3.5,340亿参数,基于790年长视频数据训练,其架构优越,推理快,能力强,还公开技术报告邀全球探索。

新智元
算法论文7

LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%

最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。

新智元
8

AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」

近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。

机器之心
算法论文8

阿里新研究:统一了VLA和世界模型

阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。

量子位
算法论文8

年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型“套出”大模型隐藏思维链,Kimi-K3重现概率异常

这篇论文指出三大前沿AI模型厂商API有密码学旁路漏洞,攻击者用轻量级模型就能恢复大模型隐藏思维链数据。还揭示部分模型训练或借鉴大模型思维链,此漏洞也致企业数据隐私安全问题。

AI前线