视觉基元推理」共找到 2553 篇相关文章

新闻资讯7

Token 新译名:「智元」

文章讨论Token新译名「智元」,认为其比「词元」更合适。介绍英伟达GTC 2026上黄仁勋强调AI推理时代智元重要性,OpenClaw消耗大量智元引争议,还提及黄仁勋闭门会观点及多位大佬对「智元」译名的认可。

新智元
算法论文8

ICLR 2026|首个微观世界模型MicroVerse来了,AI开始模拟看不见的世界

过去两年,世界模型成为大模型演进重要方向,但现有模型多聚焦宏观世界。本文提出MicroVerse模拟框架,将研究边界拓展到微观尺度,还推出MicroWorldBench评测准和MicroSim - 10K数据集,推动AI从视觉模拟迈向科学模拟。

机器之心
开源动态8

社区供稿丨Ring-2.5-1T,思更深,行更远

今天发布并开源万亿参数思考模型 Ring-2.5-1T,在生成效率、思考深度、长程执行上大幅提升。与其他模型对比,在高难推理和长程任务执行达开源领先。介绍架构优势、手搓案例,也提及不足与未来计划。

Hugging Face
产品应用8

前端同事看走眼了,这个“游戏网页”其实全是AI写的!

Kimi K2.5上新,集视觉理解、代码生成等能力于一体,提供四种使用模式,其中Agent集群模式提效显著。实测显示其网页生成、动效理解能力出色,下一代K3模型或用新架构KDA降低计算成本。

InfoQ
新闻资讯8

GPT-5.2果然反超谷歌Gemini 3 Pro!北大数院校友核心贡献

OpenAI在成立十周年推出GPT - 5.2,相比GPT - 5.1在多实用领域更强,视觉理解等能力提升。ARC - AGI测试中得分超谷歌Gemini 3 Pro。拆解其多方面能力,还介绍核心团队多为数学专业新面孔。

量子位
算法论文8

小模型大作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部大模型

近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
开源动态8

美团新独立APP,点不了菜只能点AI

美团新开源LongCat-Flash-Omni模型,支持多模态,在全模态准测试达开源SOTA水准,推理快且全模态能力强。实测交互体验丝滑,其迭代逻辑清晰。该模型成功源于架构创新,美团靠软硬件结合实现虚实连接。

量子位
开源动态8

混元3D开源端到端全景深度估计器,代码+精选全景数据已上线,在线可玩

全景深度估计在3D视觉领域日益受关注,但因全景数据稀缺、球面畸变问题,以往方法零样本泛化和效率不佳。腾讯混元3D团队提出DA²,通过数据扩充引擎和SphereViT架构,提升性能,展现SOTA表现。

量子位
产品应用7

GEO中,llms.txt是个啥?

GEO中llms.txt是新兴网络标准提案,分提案A(访问控制)和提案B(推理指导)。提案A类似robots.txt,控制内容用于模型训练;提案B是Markdown文件,助LLM理解网站。作者整理指南分享,盼业内出标准。

newtype AI
新闻资讯8

GPT-5编程专用版发布!独立连续编程7小时,简单任务提速10倍,VS Code就能用

OpenAI推出GPT-5-Codex特化版模型,支持独立连续编程7小时,有IDE插件版。新模型有“真·动态思考”能力,简单任务提速10倍,复杂任务推理更久。还重构了Codex产品体系,升级IDE扩展等。

量子位