「模型实测」共找到 7932 篇相关文章
阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜
阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。
王田苗三问具身大牛:大模型还在「拨号上网」,机器人靠什么拿下真实订单?| WRC 2026
在2026世界机器人大会的圆桌论坛上,王田苗向具身智能头部企业CXO抛出尖锐问题。嘉宾围绕量产卡点、大模型应对物理世界不确定性及产业终局生态展开讨论,并就商业化落地节奏达成共识。
微信、清华连续自回归模型CALM,新范式实现从「离散词元」到「连续向量」转变
腾讯微信 AI 联合清华提出连续自回归语言模型 CALM,它将语言建模为连续向量而非离散词元,显著改善性能与计算成本权衡,解决了 LLM 效率瓶颈,虽面临技术挑战但实验效果佳,还指明未来研究方向。
两张图就能重构3D空间?清华&NTU利用生成模型解锁空间智能新范式
ICCV 2025中稿的LangScene-X以全新生成式框架,仅用稀疏视图就能构建可泛化的3D语言嵌入场景。它攻克传统方法痛点,将多模态信息统一在单一模型,为空间智能领域打开新大门。
GPT5.5代号“蒜你狠”曝光!OpenAI拉响红色警报加班赶制新模型,最快下周就发
面对谷歌攻势,OpenAI奥特曼拉响“红色警报”,集中资源让ChatGPT赶上Gemini 3 Pro。两款新模型曝光,一款下周发布,代号Garlic的明年初或发。ChatGPT流量降,OpenAI财务压力大,Garlic能否助其破局受关注。
强化学习+MCP=王炸?开源框架教AI在MCP中玩转工具解决任务,实测效果超越GPT!
科技公司OpenPipe提出全新开源强化学习框架MCP·RL,只需一个MCP Server地址,agent就能自动发现工具、生成任务,在闭环反馈中摸索出最优调用策略,实测在2/3的benchmark上达或超SOTA性能。
谷歌发布本地具身智能模型!全程无联网执行精细操作,从人形机器人到工业机器人全覆盖
Google DeepMind团队发布可本地运行的视觉 - 语言 - 动作模型Gemini Robotics On - Device,它能离线运行,操作能力强,可在多种机器人本体部署,解决网络问题,性能、适应能力出色,还开放了SDK。
OpenAI的新浏览器实测被吐槽疯了?走“乔布斯风”、挖谷歌骨干,奥特曼就“复制”出个ChatGPT版Chrome?
OpenAI发布全新网页浏览器ChatGPT Atlas,其将ChatGPT置于网页体验核心,有常驻侧边栏助手等功能。虽冲击谷歌,但用户实测反馈不一,且此类智能代理浏览器存在新安全风险。
Claude 急了!模型降智,官方长文用 bug 搪塞?开发者怒怼“太晚了”:承认不达标为何不退钱?
8 - 9 月初Claude模型质量下降,Anthropic发文解释是因三项基础设施漏洞。介绍了三个bug及处理办法,也分析检测难的原因并给出改进方案,但很多用户已不再买账,Claude用户流失问题持续。
实测国内首个对话式AI音乐创作Agent:聊个天就能谱曲填词混剪生成MV
实测国内首个对话式AI音乐创作Agent Tunee,玩法像Suno+ChatGPT结合体。它操作简约功能全,能反复修改创作,还具备多模态内容处理能力,虽有小瑕疵,但体现国产AIGC应用发展趋势。