训练框架」共找到 3431 篇相关文章

算法论文7

1100多个模型殊途同归,指向一个「通用子空间」,柏拉图又赢一回?

约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间,表明架构比数据影响大。此发现能解释诸多现象,还有多种应用可能,但也有局限性。

机器之心
开源动态8

里程碑时刻!首个100B扩散语言模型来了,技术报告揭秘背后细节

蚂蚁集团与高校联合团队推出 LLaDA2.0 系列扩散语言模型,其中 LLaDA2.0 - flash 参数量达 100B。技术报告披露细节,其解决了 dLLM 做大做强难题,性能比肩 AR 模型,为扩散模型工业化带来转机。

机器之心
新闻资讯7

AI玩具和AI眼镜爆火,端侧市场或将超越云端?

当下AI难形成商业闭环,端侧AI或为落地答案。芯原股份戴伟民看好端侧AI市场,认为未来端侧推理需求或超云端训练,还指出AI眼镜、玩具、智能汽车等增量市场,同时介绍了芯原布局。

芯师爷
新闻资讯7

老外傻眼!明用英文提问,DeepSeek依然坚持中文思考

DeepSeek-V3.2和DeepSeek-V3.2-Speciale推理能力显著提升,海外研究者用英文提问,它却用中文思考。评论有两种观点,相关论文显示中文省token但非最有效,大模型选思考语言并非只看效率。

机器之心
算法论文8

下一代目标检测模型:3B参数MLLM Rex-Omni首度超越Grounding DINO,统一10+视觉任务

IDEA研究院团队用3B参数的Rex - Omni打破MLLM目标定位精度僵局。它统一视觉任务,结合坐标编码与强化学习,在多项检测基准超Grounding DINO等,解决定位和行为缺陷,为MLLM成下一代检测模型提供方案。

机器之心
开源动态8

杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切

上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,一上线便引发关注。今日凌晨,杨植麟等人在 Reddit 开展 AMA 活动,回应 K2 Thinking 一系列问题,还回顾了其在多项测试中的亮眼成绩。

InfoQ
开源动态8

Paper2Page: 让每一篇论文都能“自己长出”一个项目主页

AI领域论文众多,研究者难让工作脱颖而出,精美项目主页很重要但制作繁琐。AutoPage是多智能体协作框架,能将论文一键转为项目主页,经三步协作,在速度、成本、质量等方面表现出色,代码已开源。

深度学习自然语言处理
推荐文章7

强化学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在AICon 2025北京站的分享。从RLHF系统出发,结合实践展示RL系统现状与发展,探讨超大规模RL方向,涉及理论、业界实践、开源生态等,还介绍了AICon北京站活动。

InfoQ
产品应用8

当搜索遇见 AIGC:京东零售的“千人千面”素材生成实践

在 AIGC 浪潮下,视觉生成技术重构电商生态。京东零售李岩介绍“千人千面”商品素材生成技术链路,包括关键模型及实现框架,还发布焕新版京点点平台并预告新能力,推动电商个性化变革。

InfoQ
算法论文8

清华首提通用大模型滤波方法,实现零样本状态估计|NeurIPS'25

清华大学李升波教授团队在NeurIPS 2025提出LLM - Filter通用滤波器,将状态估计融入大语言模型推理框架。它能解决传统方法泛化性差问题,在未见过系统中实现零样本状态估计,有望成基础模型。

新智元