「双维度评估框架」共找到 2371 篇相关文章
微软推出深度视频探索智能体,登顶多个长视频理解基准
尽管LLMs和VLMs在视频分析和长语境处理有进展,但处理数小时长视频有局限。微软提出智能体Deep Video Discovery (DVD),以简洁框架在LVBench取得高准确率,将以MCP Server形式开源。
LeCun亲自官宣!Meta世界模型V-JEPA 2登场!仅用62小时机器人数据,就能实现零样本控制!
Meta发布V-JEPA 2世界模型及三个新基准测试,Meta首席AI科学家Yann LeCun介绍其不同。V-JEPA 2基于视频训练,用62小时机器人数据就能实现零样本控制,还将探索分层式模型和多模态建模。
LeCun世界模型出2代了!62小时搞定机器人训练,开启物理推理新时代
Meta开源发布V-JEPA 2世界模型,图灵奖得主Yann LeCun称其将为机器人技术带来新时代。该模型能理解物理世界,经训练后在多方面表现优异,Meta还发布新基准测试,也透露了后续计划。
北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师
北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。
苹果炮轰AI推理遭打脸,GitHub大佬神怒怼!复杂任务≠推理能力
苹果发表论文指出推理大模型存在重大缺陷,相关解读在社交平台广泛传播。但GitHub高级工程师Sean Goedecke对论文持保留态度,认为谜题不是评估推理能力的好试验场,模型放弃不代表无推理能力。
图解Vllm V1系列4:加载模型权重(load_model)
文章聚焦vllm加载模型权重的流程。从入口函数切入,详细分析DefaultModelLoader的工作步骤,包括初始化模型架构和实际加载权重,还给出各步骤代码及作用,为想操作load_model的人提供框架。
什么!我把SQL编辑器装进了大模型?
文章介绍基于约束解码技术,结合CFG、Jinja模板和XGrammar框架,为大模型SQL生成配备“编辑器”。它能保证语法正确、遵循规则,还具灵活性。但面临约束干扰和性能瓶颈,未来可简化配置惠及更多用户。
V0 模型直接进驻 Cursor,UI 生成效果炸裂,氛围编码体验再升级。
AI 编码赛道竞争激烈,Vercel 的 V0 发布 AI 模型,可在 Cursor 中使用,还推出新工作流提升 UI 生成效果。文中介绍了 V0 特点、Cursor 设置方法及使用演示,还分析了 Vercel 自研模型的原因。
三金,又是中国队!全球机器人视触融合挑战赛揭榜
ManiSkill - ViTac 2025视触觉融合挑战赛揭榜,全球42支团队参赛,中国两家具身初创公司包揽三金。该赛事聚焦视触觉融合技术,为机器人行业搭建从实验室到现实应用的桥梁,推动相关算法和硬件进步。
OpenAI 正式发布企业级 AI 落地实践报告:7大经验教训
OpenAI发布《AI in the Enterprise》报告,分享与7家“前沿公司”合作将AI引入企业的经验教训,涉及提升员工效能等方面,并阐述7条关键经验及案例,还提及企业集成AI工作流等新趋势。