视觉几何基准」共找到 1507 篇相关文章

新闻资讯7

GPT-5.4据传下周上线!200万上下文窗口+持久化状态,告别频繁遗忘

OpenAI工程师在GitHub仓库意外泄露GPT - 5.4,相关信息流传后被撤回。据传下周上线,其有200万Tokens上下文窗口与持久记忆,支持全分辨率视觉直读,将引发硬件内存之战。

新智元
开源动态8

这个开源PDF解析器,拿了全球第一

OpenDataLoader在主流PDF解析器基准测试中排第一,尤其是表格提取准确率高。它功能丰富,有本地和混合两种模式,还将推出免费自动标记功能,支持与LangChain集成。

GitHubStore
算法论文8

攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产

新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。

机器之心
算法论文8

为什么自监督永远学不到语义?

《Visual Language Hypothesis》论文用纤维丛理论审视视觉表征学习,指出只做连续变换难触达语义。分析现有无监督学习不足,提出“Expand - and - Snap”机制,还通过实验验证,提供审视AI架构新视角。

深度学习自然语言处理
算法论文8

AI 如何讲好一个多人故事?首个支持多角色互动的3D场景叙事系统

首尔国立大学提出全新框架,能生成虚拟动态场景并支持多角色上下文动作生成。引入LLM拆解复杂任务,系统用事件驱动方式规划动作,还构建基准评估相关能力,有良好扩展性和实用性。

带你学AI
产品应用7

Vibe Coding 继续:这次,AI Studio 让你可以“画着改UI”

谷歌在AI Studio中引入注释模式,可乱涂乱画用注释命令修改,能更自然地更改应用,与Gemini进行直观视觉对话,还提到Cursor等IDE中类似功能实现方式。

AI进修生
开源动态7

1200行代码逆袭!DeepSeek工程师开源轻量级vLLM,吞吐量逼近原版

开源 vLLM 可提升 LLM 推理速度和资源利用率。近日,DeepSeek 工程师俞星凯开源轻量级 Nano - vLLM,代码仅 1200 行,基准测试中吞吐量逼近原版,项目已在 GitHub 获 200 多 Star。

机器之心
算法论文8

用雨伞「钓」无人机?首个针对自主目标跟踪闭环系统的物理攻击

加州大学尔湾分校研究人员用特制雨伞干扰无人机视觉系统,实现FlyTrap攻击,让无人机误判目标远去而失控俯冲。此攻击无需信号干扰,成功率超60%,有强泛化能力,揭示了AI感知系统安全隐患。

新智元
开源动态8

斩获22K star!再见重复劳动,微软AI开源智能办公机器人来了!抓紧用起来

微软推出视觉自动化神器`OmniParser`,上线GitHub获22K star。它重新定义人机协作,有三大能力、五大自动化杀手锏,适用于六大实战场景,还给出速成指南,与同类方案相比优势明显,正重塑办公范式。

小华同学ai
推荐文章8

数学大佬在前面拓荒,AI研究员在后面捡宝,菲尔兹奖还能拿来破AI「黑盒」?

菲尔兹奖级纯数学成果落地大模型训练。佛罗里达大学团队用三维挂谷猜想解决大模型“黑盒问题”,GeoLAN加几何约束,效果显著。菲尔兹奖得主Jacob将入职OpenAI,AI在数学领域成果频出。

AI科技评论