图像质量评估」共找到 1653 篇相关文章

算法论文8

全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案

随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。

机器之心
7

硅谷10万大裁员真相:AI根本没想取代你,是老板想干掉你

美国科技公司正大规模裁员,10月裁员人数暴涨。出版业大亨认为AI或致全民失业或经济崩盘,Meta用AI辅助绩效评估。AI常成裁员借口,实则与盲目扩招、财务压力等有关,美国大学文凭也在贬值。

新智元
产品应用7

理解规范驱动开发:Kiro、spec-kit和Tessl

作者尝试理解规范驱动开发(SDD),查看了 Kiro、spec - kit 和 Tessl 三个自称 SDD 的工具。介绍了 SDD 定义、规范含义,分析评估工具的挑战,还指出工具存在不适合多数编程问题、审查体验差等问题。

InfoQ
推荐文章8

视觉生成的另一条路:Infinity 自回归架构的原理与实践

本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。

InfoQ
算法论文7

大模型在具身推理上「翻车」了?4496 道题全面揭示短板

美国东北大学等提出BEAR基准评估MLLM具身智能子能力,用4496道题测试20个模型。发现多模态大模型具身能力不足,还分析错因,开发BEAR - Agent提升模型具身推理能力,在仿真测试中效果显著。

机器之心
算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元
开源动态8

刚刚,Andrej Karpathy放出大招:开源nanochat项目,仅8000行代码100美元就能训练出一个ChatGPT

Andrej Karpathy发布nanochat项目,用8000行代码实现ChatGPT完整训练流程。在8xH100节点跑4小时、花100美元,就能有对话、写故事、答题的AI助手。项目覆盖广,含多训练步骤及评估体系。

AGI Hunt
产品应用7

产品经理也能“开发”需求?淘宝信息流从需求到上线的AI端到端实践

淘宝推荐信息流业务被“需求多、技术栈杂、协作慢”困扰,上线周期长。WaterFlow这一AI驱动的端到端开发实践,让部分需求两天内上线,产品经理也能参与。文章揭秘其落地及协作模式改变,还展示了实践效果。

阿里云开发者
产品应用8

字节Seed发布PXDesign:蛋白设计效率提升十倍,进入实用新阶段

字节跳动Seed团队提出可扩展蛋白设计方法PXDesign,24小时生成数百高质量候选蛋白,效率较主流方法提升约10倍,湿实验成功率达20%–73%。还推出公开免费在线服务,提供配套工具加速应用落地。

量子位
算法论文8

NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理

面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

机器之心