「视频处理」共找到 1872 篇相关文章
【梁文锋署名】DeepSeek再发新论文:75%思考+25%记忆,这是他们算出来的最优解
DeepSeek新论文《Conditional Memory via Scalable Lookup》提出Engram模块,指出大模型用计算模拟查字典是浪费算力,Engram能给模型装“记忆”,还发现参数分配呈U型缩放定律,推理和长上下文能力提升显著。
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
阿里通义新年礼物:开源最强Qwen-Image-2512版本告别AI塑料感与文字乱码
通义万相新年前发布Qwen - Image - 2512版本。它是开源界最强文生图模型,在AI Arena盲测中表现出色。能消除AI塑料感,攻克文字渲染难题,在还原真实世界和重构视觉元素逻辑排版上有显著提升。
美国模型长期霸榜的LMArena,出现了一个国产模型
2025 年底,中美 AI 阵营发展路径有区分,美国多是强模型加工具链,中国在多方面发力。12 月 23 日 LMArena 更新文本榜,百度文心新模型 ERNIE - 5.0 - Preview - 1203 以 1451 分登上榜单,成中国第一且是前 20 名里唯一非美国模型。
Pulsar特性在AI场景中的使用
随着AI发展,架构从单体到分布式演进,消息中间件成关键。Pulsar以存算分离等特性价值凸显,在多模态训练、模型训练、智能体等AI场景有独特优势,如处理超大消息、实现断点续训等。
万相2.6 X千问APP,功能价值和情绪价值兼具|甲子光年
12月16日阿里发布视频生成模型“万相2.6”,实现“角色扮演”功能突破。千问APP接入后上线“AI小剧场”,打破次元壁。千问兼具功能与情绪价值,阿里全栈布局助力其成“超级入口”。
Macaron 新版本拆解:三个信号,看懂 Personal AI 的进化路径
Macaron新版本技术视频技术浓度超预期,结尾藏产品更新彩蛋。此次更新社交功能、Daily Spark、记忆打通等背后,藏着Personal AI关键变化,其团队Mind Lab有技术突破,开源方案获高认可。
连肝12小时!一轮狂刷1500篇论文,写4.2万行代码,AI科学家卷疯科研圈
Kosmos是一款全程无需人类插手的AI科学家,最长能连续工作12小时,平均一次研究读1500篇论文、写4.2万行分析代码,79%研究结果可被人类复现,已在多领域有7个真发现。
天下苦VAE久矣:阿里高德提出像素空间生成模型训练范式, 彻底告别VAE依赖
当前主流图像生成技术训练范式依赖VAE,带来训练复杂、微调成本高的问题。阿里高德提出EPG,结合自监督预训练与端到端微调,去除对VAE依赖,在训练效率和生成效果上有突破。
EMNLP2025 | 解耦视觉与推理,港大探索视觉语言模型"眼智分离"新范式
当前大视觉语言模型处理复杂推理任务时,常过分依赖语言知识,忽视图像关键信息。港大等团队提出ProReason框架,其蒸馏的ProReason - VL和ProReason - Q3模型性能提升显著,为LVLMs发展提供方向。