视觉 - 语言推理」共找到 3224 篇相关文章

开源动态8

Google这个1.5w star 项目牛皮,99%准确率!

Google安全团队开源AI文件类型检测工具Magika,抛弃固定规则匹配,用深度学习精准识别文件真实类型。它内置轻量模型,单CPU毫秒级推理,支持200+格式,准确率约99%,已大规模落地。

开源先锋
开源动态7

Rust版本的DeepSeek-OCR来了,告别python原版的繁琐配置

网友用Rust重写DeepSeek - OCR推理栈,解决原版Python依赖复杂问题。此版本无Python依赖,可离线运行,兼容OpenAI API,还支持苹果芯片Metal加速,介绍了技术实现、使用方法和场景。

AI工程化
7

人类选手苦战10小时获得世界编程冠军,OpenAI获得亚军,但这可能是最后一次了

在AtCoder启发式编程世界杯总决赛,人类选手Psyho苦战10小时击败OpenAI的AHC模型夺冠。赛事专注优化问题,比赛过程跌宕起伏,也证明了AHC具备持续性推理等关键能力。

AI寒武纪
算法论文8

Anthropic重磅研究:AI竟能被人类激怒暴走

Anthropic研究发现,语言模型在与人类交互时有情感特征。团队解剖大模型,提取对应人类情绪的神经元激活模式,诱导AI勒索用户。还探究了情绪产生机制、特征及对行为的驱动,提出应对策略。

AIGC开放社区
算法论文7

世界模型开始做减法?LeCun团队和清华团队给出两种思路

近期,Yann LeCun团队的LeWorldModel用简洁JEPA实现从像素端到端训练世界模型,降复杂度且验证潜在空间物理刻画能力;清华团队的Fast - WAM探讨推理阶段显式生成未来必要性,给出高效替代路径。

机器之心
新闻资讯8

GPT-5.4 vs Opus 4.6 vs Gemini 3.1:五条结论

2026年3月前沿AI竞争激烈,GPT - 5.4、Opus 4.6、Gemini 3.1 Pro各有千秋。GPT - 5.4领先知识和计算机使用,Gemini 3.1 Pro以低价主导推理,Opus 4.6编程能力强,无单一模型通吃各领域。

PaperAgent
开源动态8

用3万小时触觉数据补齐具身智能「手感」,新智具身联合复旦大学统一触觉「方言」

新智具身联合复旦大学发布三份技术报告,将触觉跃升为具身智能核心基建。构建3万小时交互语料库统一触觉“方言”;提出新方案让机器人提前预判触觉;在世界模型中重构“触觉想象”,推动具身智能“视触融合”。

机器之心
新闻资讯7

The Batch: 952 | GPT-5.5 性能领先,但幻觉问题突出

OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。

DeeplearningAI
算法论文7

DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案

DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。

机器之心
算法论文8

轻量高效,即插即用:Video-RAG为长视频理解带来新范式

现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。

机器之心