「统一模型框架」共找到 8499 篇相关文章
马斯克新模型背后算法来自英伟达???
Grok-4-fast降本增效表现出色,其背后或许关联英伟达算法论文。论文推出Jet-Nemotron模型,靠PortNAS框架降本提效,还开源代码。网友猜测Grok-4-fast基于此模型,也有人认为是营销手段。
安全垂类小模型效果能超过大模型?看看以色列Novee的效果
跟踪AI渗透测试等开源应用发现,通用大模型成本高、功能受限。以色列Novee融资5150万美元并发布4B小模型,测试效果超Claude 4 Sonnet。其靠两阶段训练和浏览器反馈提升能力,有投资说明有价值。
GPT-Image-2平替!最强开源生图模型来了
OpenAI推出GPT Image 2引发AI生图大战,国内厂商商汤反击,推出多模态理解生成模型SenseNova U1并全面开源。它通过自研架构实现理解、推理、生成统一,实测表现惊艳,能力全维度,与GPT-Image-2范式不同。
上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体
上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。
不止Deep,更要Wide:清华、无问芯穹发布多智能体系统WideSeek-R1,4B模型比肩671B模型!
清华与无问芯穹的RLinf团队提出「广度扩展」,发布多智能体系统WideSeek-R1。它采用「Lead-agent-Subagent」框架,经MARL端到端训练,4B模型在广度搜索任务表现比肩671B模型,且在标准QA任务也出色。
翁荔创业大模型首秀!告别“120亿美元估值0模型”
Thinking Machines Lab发布首个模型TML - Interaction - Small,联合创始人翁荔演示。该模型让实时交互成原生能力,响应延迟比GPT - realtime - 2.0快4倍,解决了多数AI“回合制”问题,还介绍了实现机制和公司过往情况。
把VLM塞进隐式世界模型,小鹏机器人新框架让机器人长出物理直觉
机器人大脑架构中VLM和VAM路线各有短板,香港大学、小鹏机器人等团队提出DIAL框架,让VLM在原生特征空间做隐式世界建模,解耦认知决策与底层执行,在机器人部署中表现优异。
让LLM不再话痨,快手HiPO框架来了
当前LLM存在‘过度思考’困境,效率与成本矛盾突出。快手与南大合作推出HiPO框架,通过混合数据冷启动和混合强化学习奖励系统,让模型能自主决策思考模式,实验显示它提升了效率和准确率,还具强泛化性。
12.1万高难度数学题让模型性能大涨,覆盖FIMO/Putnam等顶级赛事难度,腾讯上海交大出品
腾讯AI Lab与上海交大团队联合推出首个基于自然语言的数学定理证明框架与数据集DeepTheorem。12.1万道高难度数学“特训题”让模型定理证明性能大涨,7B模型性能比肩或超越现有开源和商业模型。
大模型顿悟原理!Meta新论文说清楚了
Meta超级智能实验室(FAIR)最新论文把大模型顿悟(grokking)现象的数学机制说清楚了。提出Li2数学框架,将两层神经网络的grokking动态分三阶段,还推导了泛化缩放定律等。