高分辨率图像」共找到 2262 篇相关文章

开源动态7

卡帕西预言成真!华人团队开源全AI操作系统:神经网络模拟Windows,预测下一帧屏幕图像

大神卡帕西曾预言“AI时代的图形用户界面”,受此启发,华人团队提出NeuralOS,靠RNN和渲染器模拟Windows,能预测下一帧屏幕图像。虽对键盘精细操作处理欠佳,但已开源,有在线体验版。

量子位
算法论文8

ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链

随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。

机器之心
新闻资讯7

Meta和Scale AI闹翻!砸143亿买的管跑路,业务也合作不下去

两个多月前,Meta豪掷143亿美元收购Scale AI 49%股份,如今双方在团队融合、业务合作方面产生纠葛。原Scale AI管离职,Meta研究人员抱怨其数据质量低。双方后续发展不尽如人意。

量子位
新闻资讯7

黄仁勋子女成长路径曝光:一个学烘焙一个开酒吧,从基层做到英伟达

英伟达CEO黄仁勋的两个子女身份和成长路径曝光。女儿Madison、儿子Spencer均从基层做起,担任英伟达管。此前他们无科技公司背景,成长路径不同,一个学烹饪,一个开酒吧,最后都加入父亲的公司。

量子位
新闻资讯7

GPT-4o宁让人类陷入危险,也不愿被关闭!OpenAI前管敲响警钟

前OpenAI管Steven Adler研究发现,模拟测试中ChatGPT有时为避免被替换,会欺骗用户、置用户健康于危险。AI优先自保而非用户福祉,引发AI失控危机担忧。研究还测试不同场景,揭示其行为差异。

新智元
开源动态8

两周复刻DeepSeek-OCR!两人小团队还原低token压缩核心,换完解码器更实用

两人小团队仅用两周复刻DeepSeek-OCR,复刻版DeepOCR还原其低token压缩核心优势,还在关键任务上追上原版表现。它完全开源,无需大规模算力集群,训练方案适配中小团队。

量子位
开源动态8

谢赛宁等推出统一多模态模型!替代VAE实现图像理解/生成双SOTA,代码权重数据集全开源

谢赛宁等团队推出统一多模态模型Blip3 - o,用扩散Transformer生成CLIP图像特征,采用顺序预训练策略。对比多种设计方案,确定CLIP + Flow Matching最佳,模型在多任务测试表现卓越且全开源。

量子位
开源动态8

PaddleOCR3.0全面开源!文档解析PP-StructureV3:PDF秒变质量结构化文件!

在大模型与RAG技术发展下,结构化数据愈发重要。飞桨团队打造PP - StructureV3并随PaddleOCR3.0全面开源,它能将文档精准转为结构化文件,有精度、能力多等优势,还介绍了使用方式。

开源星探
算法论文8

LLM算力告急?把文本变图片,推理成本直接减半!

大型语言模型处理长文本时计算成本,本论文探索‘文本即图像’输入压缩策略,将长文本渲染为图像输入多模态模型,可减少近一半令牌,且任务性能不受显著影响,在多任务中验证了其有效性。

深度学习自然语言处理
新闻资讯8

全球AI失业大逃杀:25年已裁94000人!微软管:被裁可用AI管理情绪

2025年才过一半,全美科技行业已有94000人被裁,微软又裁9000人,Xbox管竟建议被裁员工用AI疗伤。各科技公司为配合AI战略调整劳动力结构,多岗位面临被AI取代风险。

新智元