「图像生成评估」共找到 2995 篇相关文章
AI Code要变天了,Meta首个代码世界模型登场!
Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更大规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。
香港科技大学、Manycor开源空间大模型,超3000颗星
香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。
3D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32%
中科院自动化所提出BridgeVLA模型,将3D输入投影为2D图像并利用2D热图进行动作预测。它训练分两阶段,在多仿真基准和真机实验表现卓越,仅3条轨迹基础任务成功率达96.8%,真机性能提升32%。
传统RAG只会翻书不会用?RAG+让Reasoning能力上一个新高度!
现有检索增强生成(RAG)技术在需复杂推理领域表现不佳,像只给菜谱不给实操演示。RAG+开创性新增“应用案例库”,与知识库构成双料库,在数学、法律、医疗场景测试中全面碾压传统方案,团队还透露了未来方向。
超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试
加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。
Karpathy、Claude Code之父Boris,最新访谈,把整个程序员圈炸了!
假期红衫AI Ascent 2026上,Claude Code之父Boris与Karpathy演讲引发关注。Boris称编程执行层已解决,他用Claude App工作,全公司代码由模型生成;Karpathy提出Software 3.0概念,还谈到模型能力不均匀。两人还对面试、创业等给出看法。
大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间
随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。
阿里云Tair KVCache仿真分析:高精度的计算和缓存模拟设计与实现
阿里云Tair KVCache团队推出Tair - KVCache - HiSim,这是面向分布式多级KVCache管理的高保真LLM推理仿真分析工具。它能在通用CPU上高精度预测性能,支撑计算选型、存储规划和调度协同等决策,还介绍了其架构、组件、验证及性能评估等内容。
AI 取代不了放射科医生
人们曾认为AI图像识别技术会让放射科医生被淘汰,如杰弗里·辛顿预言应停止培训该类医生。但过去十年,放射科医生需求反而增加。文章以其为例,分析AI难取代的原因,如基准测试局限、医生工作复杂、AI落地困难等。
最新实测GPT-5-Codex:前端能力碾压,复杂项目轻松搞定,Claude可以扔了!
OpenAI发布GPT-5-Codex,网友称可告别Claude Code。实测其前端能力提升大,能轻松完成复杂项目,如一键生成小游戏、手稿直出网页等。虽有页面UI堆叠小瑕疵,但仍值得支持。此外,Grok 4有突破,马斯克看好Grok 5。