视觉领域」共找到 2295 篇相关文章

开源动态8

腾讯重磅开源:端到端文档转换VLM,中英文错误率双料最佳!

腾讯开源端到端文档转换视觉模型POINTS - Reader,可将文档图片转结构化文本。它基于POINTS1.5架构,支持中英文。在OmniDocBench基准上,中英文错误率暂列最佳,具零后处理简单等亮点。

开源星探
推荐文章7

119 页硬核报告丨AI 2030:算力、能源与科研的未来预测

Epoch AI 受 Google DeepMind 委托编写报告,探讨 AI 规模扩张至 2030 年在计算、投资等方面的影响,认为扩张很可能持续,还会加速多领域科学研发,虽预测有不确定性,但 AI 会成关键技术。

特工宇宙
新闻资讯8

来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!

OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。

新智元
算法论文7

“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%

文章聚焦多模态长文档视觉问答,介绍现有LVLM - based和RAG - based技术路线及困境。提出MMRAG - DocQA方案,引入‘分层索引 + 多粒度检索’,设计双索引建模相关性与依赖,用互补策略实现证据互补。

CourseAI
算法论文8

自回归模型杀回图像生成!实现像素级精准控制,比Diffusion更高效可控

当下AI图像生成领域,Diffusion模型虽为主流,但在精准控制上有不足。伊利诺伊大学香槟分校等机构研究者提出MENTOR框架,用自回归模型实现像素级精准控制,比Diffusion更高效可控。

量子位
新闻资讯7

一家00后创办的世界模型公司,凭什么让华为哈勃重金押注?

近日,00后创办的魔芯科技完成Pre - A +轮近亿元融资,由华为哈勃领投。该公司从3D AI物体建模出发,研究独特技术路线,在科研和产品应用有突破,正将能力落地多领域

机器之心
新闻资讯8

已近2000亿美元注入,彭博社盘点2026年值得关注的24家AI初创公司

截至今年10月初,近2000亿美元注入人工智能初创企业。彭博社盘点2026年值得关注的24家AI初创公司,涉及模型开发、代码创作、实体智能等领域,还展现了AI产业思想分野。

AIGC开放社区
新闻资讯7

AI“画饼”画不动了?从狂热到冷静,行业迎来大消化

AI正处关键转折点,炒作撞上现实。企业认清其能力边界,期望回归理性。虽有泡沫讨论,但AI已在部分领域产生影响。它迎来“iPhone 4时刻”,进入持续迭代阶段,放缓源于炒作与边际效益递减。

AI寒武纪
新闻资讯8

零GPU,世界第一超算!深圳制造改写游戏规则了

中山大学教授带队、深圳制造的灵晟超算登顶全球超算TOP500榜单,零GPU采用纯CPU架构,全链路自研。图灵奖得主评价其为“AI4S新型架构的希望之光”,还在多领域展开应用。

量子位
新闻资讯7

AI下一前沿是模拟社会!「斯坦福AI小镇」创业后,西部世界雏形初现

业界热议人工智能的下一个前沿,斯坦福大学副教授 Percy Liang 认为是模拟社会,他所在创业公司完成 1 亿美元融资。模拟社会可预测情景、优化结果,Simile 团队开创 AI 模拟领域,但面临开发模型、高效模拟、建立信任等挑战。

机器之心