「视觉推理能力」共找到 4874 篇相关文章
PDF难点解析:处理复杂表格、水印、印章、复选框、信息抽取等7项任务,6大能力
文章介绍Nanonets - OCR - s可处理关键信息提取、视觉问答等7项任务,具备LaTeX方程识别、图像描述等6项能力,还给出体验链接。但测试发现英文体验优于中文,模型有重复输出、幻觉严重问题。
MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。
MiniMax深夜开源首个推理模型M1,其上下文能力媲美Gemini 2.5 Pro。M1在部分评测中表现中规中矩,但在MRCR(4 - needle)测试中屠榜。它得益于MiniMax - 01基座模型,应用Lightning Attention机制,开源了40K和80K两个版本。
GPT-6 真要来了!OpenAI全新推理架构“循环深度”首次曝光:可榨出14倍参数潜能
OpenAI将推旗舰模型GPT - 6(内部代号Astra),采用“循环深度”新技术,能榨出14倍参数潜能,降低成本,但会使AI推理过程不可读,加重安全担忧。OpenAI已因该模型“能力过强”踩刹车。
教多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题
上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。
打破大模型编程「数据污染」与「能力虚胖」困境,Meituan-M17团队构建新一代AI编程评测新标准——OIBench
当前大语言模型编程能力评估体系问题多,如评测集饱和、数据泄漏等。Meituan - M17团队推出OIBench数据集,对18个主流大模型评测,揭示模型真实水平,还将举办人机协作编程竞赛。
奥特曼点评中美AI牌桌:美国猛攻前沿,中国凭“两张王牌”错位竞争
OpenAI CEO 萨姆·奥特曼在贝莱德峰会上指出,从 o1 到 o3 模型,复杂推理成本降 1000 倍,2028 年末数据中心 AI 认知能力或超人类。他还拆解中美 AI 竞争,美国前沿领先,中国旧模型推理成本控制和基建推进有优势。
谷歌全线开挂!Gemini 3 Deep Think夺多项推理SOTA,Gemini亚洲新团队也官宣了
谷歌的Gemini 3 Deep Think模式正式上线,推理能力显著加强,在ARC - AGI、HLE等多项权威测评中夺魁,仅向Google AI Ultra订阅用户开放。同时,谷歌DeepMind将在新加坡成立新的Gemini研究团队,由95后华人科学家Yi Tay带队。此外,谷歌还推出了Google Workspace Studio。
《TAML》好文推荐 | 来自中国科学院力学研究所张磊博士 评估大语言模型在计算流体力学领域的知识利用、学习与创造
研究聚焦评估推理型(DeepSeek R1和OpenAI o3 - mini - high)与非推理型(DeepSeek V3和ChatGPT 4o)大语言模型在计算流体力学领域知识利用、学习与创造能力。通过三类基准问题评估,结果有差异。
ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准
文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。
GTC 巅峰对话 Jeff Dean x Bill Dally:预训练范式已死、延迟瓶颈不在计算、谈透 AI 五年未来 | GTC 2026
GTC 2026上,NVIDIA首席科学家Bill Dally和Google Jeff Dean展开重磅对话。讨论了模型能力进步、低延迟推理架构、模型自主进化、数据与算力、训练与推理硬件差别等多方面内容,分享对未来AI的看法与见解。