「大物理模型」共找到 9333 篇相关文章
全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%
MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。
X-Era蝉联双榜单冠军,引领世界模型未来方向
X-Era的EonWorld在WorldScore和WorldArena两个榜单上连续霸榜。它来自X-Era的VWA原生世界动作模型体系,本职是帮机器人预判世界变化。这为“可用于行动的世界模型”竖起能力线,也揭示行业正进入新阶段。
ACL 2026 | 别轻易给AI发「~」,它可能会删掉你的整个主目录
西安交通大学等校团队揭示大模型表情符号语义混淆安全漏洞,用自动化框架测试主流大模型,平均混淆率38.6%,多数混淆响应会“静默失败”,超半数达高危害级别。
烧了1万块横测,你用的模型可能掉队了
作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。
VLA 推理新范式!一致性模型 CEED-VLA 实现四倍加速!
近年来,VLA模型成机器人领域重要研究方向,但推理速度受限。本文提出一致性蒸馏训练、混合标签监督机制及提前退出解码策略,在多基线模型上实现超4倍推理加速,实验验证其高效通用。
OpenAI的开源,补全了亚马逊云科技模型生态的最后拼图
8月5日OpenAI上线两款开源模型,亚马逊云科技随即在旗下平台上线。此前微软借合作优势使Azure高速增长,如今OpenAI开源,亚马逊云科技模型生态更丰富,其产品受客户好评,增长势头难挡。
Physical Intelligence 核心技术团队分享:物理世界的“Vibe Coding”如何实现?
Physical Intelligence 核心技术团队解读机器人技术路径,分享前沿探索。介绍 VLA 与 VLM、LLM 关系,还提及 PI 构建数据管线、提出“知识绝缘”机制,分析开放世界部署难题,展望未来“机器人模型即服务”。
从预测到干预,Aether AI为什么押注因果世界模型?
Aether AI 定义技术路线为「因果世界模型」,关注模型识别影响结果的变量、理解因果结构、模拟干预后果。它从预测未来的局限切入,介绍了因果能力的三类核心问题及研究成果,还用四层架构实现能力落地。创始人黄碧薇看好当下时机,从 Physical AI 切入创业。
Java 世界的 MCP:将架构策略应用于 LLM 集成
文章指出大语言模型成企业架构组件,但当前集成脆弱。MCP 引入标准化方法,其 Java SDK 重要。文中介绍 MCP 架构、特点,分析其与原生工具调用的权衡,还通过案例展示应用,最后说明适用场景。
美团视频生成模型来了!一出手就是开源SOTA
美团开源视频生成模型LongCat - Video,参数13.6B,支持文生/图生视频,时长可达数分钟,生成视频真实自然,文生视频能力顶尖,整体质量优,采用MIT协议。还介绍了其功能、技术原理及美团此前的AI成果。