视觉Token筛选」共找到 1334 篇相关文章

算法论文8

中山大学梁小丹团队论文:让视频生成从「看起来真实」到「物理上正确」丨CVPR 2026

中山大学梁小丹团队提出《ProPhy: Progressive Physical Alignment for Dynamic World Simulation》,通过分层建模和逐步对齐,引入视觉语言模型作监督,解决视频生成模型物理建模问题,提升物理正确性和视频质量。

AI科技评论
推荐文章8

AGI 投资清单:为什么这 30+公司值得关注?|Best Ideas

今年 AI 进入‘业绩兑现期’,市场看重真实效益和收入。文章围绕技术、资本开支和宏观趋势筛选 30+ 公司,覆盖多领域,分析各公司优势与投资价值,为投资者提供参考。

海外独角兽
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
开源动态7

一夜狂揽 6k Star,232 个 AI 专家,真疯了!

开源项目 `The Agency (agency-agents)` 增长惊人,单日获 6K+ Stars,十天新增 3.3 万+。它打包开源 232 个 AI Agent 角色、16 个部门,各 Agent 有完整“人格系统”,支持多种主流工具,不过 Token 消耗大。

开源先锋
算法论文8

MIT这篇RLM论文,给出了Scaling的另一种可能~

当大家普遍认为解决长上下文问题要靠扩大模型上下文窗口时,MIT 最新的 RLM 论文提出新路径。其 code 已开源,能实现无界上下文处理,可让任意大语言模型处理 10 万 +token

PaperAgent
产品应用8

新晋顶流Agent颠覆设计师!Lovart一手实测来了:是该刷屏爆火

新晋顶流Agent Lovart火爆全网,可一句话搞定专业视觉设计,支持二次编辑。量子位实测其设计能力强,背后是多模型融合调度。它定位人机协作,适合中小企业,官网可申请内测。

量子位
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看图的方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看图方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态。

花叔
开源动态8

这款OCR神器绝了,PDF、表格、手写体通吃,20+文档支持,9.4K Star!

开源君在Github发现开源OCR工具Zerox,由Omni - AI团队开发,利用AI视觉模型“阅读”文档,将多种格式文档转Markdown。它功能强大,处理复杂文档优势明显,在Github获9.4K Star。

开源先锋
开源动态7

MIT团队完成AI控制人类行为实验项目

MIT团队的Human Operator项目是实时人体增强工具,也是MIT Hard Mode 2026获奖项目。它通过视觉 - 语言模型结合电刺激肌肉实现人体运动控制,介绍了技术栈、环境要求、软硬件准备、安装步骤等。

GitHubStore
新闻资讯7

我在OpenAI修中文

OpenAI研究科学家陈博远介绍GPT Image 2官网博客花絮,分享模型训练、测试情况,还展示亲手制作的官网图片,包括中文彩蛋、漫画、杂志页等,体现模型文字渲染、视觉推理等能力。

机器之心