效果提升」共找到 3546 篇相关文章

算法论文7

函数向量对齐技术,让大模型持续学习不“失忆”丨ICLR 2025

中国科学技术大学等校团队破解大语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。

量子位
产品应用8

还得是华为!Pangu Ultra MoE架构:不用GPU,你也可以这样训练准万亿MoE大模型

华为盘古团队发布Pangu Ultra MoE模型架构与训练方法的中文技术报告。该模型全流程在昇腾NPU上训练,团队在架构和训练方法创新,实现准万亿MoE模型训练,还在多方面优化提升性能。

机器之心
新闻资讯7

MIT爆火论文被曝数据造假!曾验证AI辅助科研增速44%,诺奖得主都被诓了

MIT一篇名为“Artificial Intelligence, Scientific Discovery, and Product Innovation”的论文曾轰动学术圈,表明AI辅助科研有显著效果。但半年不到,因涉嫌关键实验数据造假被责令撤稿,作者已离开MIT,论文暂未从arxiv下架。

量子位
算法论文8

ICRA 2025|通用多机器人长时任务规划框架破解任务分配难题,成功率+105%、效率+36%

2025年5月,美两校联合团队在ICRA 2025发布LaMMA - P。它融合大模型与PDDL规划器,解决异构多机器人长时任务分配难题,在新基准数据集上,相比SMART - LLM,任务成功率提高105%,执行效率提升36%。

机器之心
开源动态8

阿里Qwen3技术报告核心要点解读!

阿里Qwen3技术报告发布,披露模型架构、预训练及后训练等技术细节。其有密集与混合专家两种模型架构,预训练数据量和语种增多,后训练采用强到弱蒸馏提升性能,各模型表现优异。

PaperAgent
算法论文8

14B检索能力超过Google Search,阿里ZeroSearch通过RL激发LLM检索推理能力~

有效信息搜索对提升LLMs推理和生成能力重要,当前RL方法有文档质量不可控和API成本高问题。阿里通义Lab提出ZEROSEARCH框架,经多步骤训练,实验显示其在检索能力和泛化性上表现出色。

PaperAgent
新闻资讯7

给企业当“AI管家”,以色列初创一年估值50亿

当地时间9月2日,荷兰AI初创公司Wonderful完成5.5亿美元C轮融资,估值达50亿。其提供AI操作系统,让不同AI共享数据、协作。它解决企业多智能体协同难题,产品已在以色列医疗保健机构取得良好效果

DeepTech深科技
产品应用7

交互式世界模型来了:不止理解世界,更要改造世界

8月17日,智象未来发布交互式世界模型HiDream - O1 - World,定位为全球首款原生全模态交互式世界模型。它提供漫游和编辑两种交互方式,在WBench测试中成绩优异,但开放场景表现待验证。其采用独特生成方式,有广阔应用前景。

DeepTech深科技
新闻资讯7

谢尔盖・布林再次进入「创始人模式」?Google押注「AI自我进化」

据路透社报道,Google联合创始人谢尔盖・布林深度介入AI研发,推动递归式自我改进(RSI)方向。此前Google新一代Gemini旗舰模型发布推迟,内部测试显示在关键领域落后对手,此次调整或为提升研发效率。

机器之心
新闻资讯7

DeepSeek,Qwen,Grok组团发布,社区一手实测

LLM大爆发,一天内推出Grok 4.6、Qwen3.8 - Max、DeepSeek - V4 - Pro - 0813三款前沿产品。社区对它们进行多场景测试,如3D场景、Flappy游戏、飞机滑行动画等,并对比了不同模型的性能、价格和输出质量。

PaperAgent