「数据使用」共找到 3674 篇相关文章
PixelRefer :让AI从“看大图”走向“看懂每个对象”
多模态大模型多停留在整体场景级理解,现实任务需细粒度、对象级理解。浙江大学等联合提出PixelRefer框架,可实现精细视觉指代与推理,在多项任务表现领先,轻量版性能优,还开源两类数据集。
英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万
英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。
华为世界模型来了!单卡30分钟生成272㎡场景
华为联合上海交通大学、华中科技大学推出世界模型WordGrow,可生成1800㎡超大室内场景,单卡30分钟跑272㎡。它用数据精准预处理、3D块补全机制、粗到精生成策略填3D场景构建的坑,指标优、速度快。
浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力
浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。
先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?
多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。
CUDA-MODE第77课课程笔记:用于GPU kernels的DSL
该课程笔记由Tri Dao介绍GPU kernel开发的DSL生态,涵盖PyTorch、Triton、Cute - DSL等。提出计算效率评估公式,对比不同DSL在Softmax、GEMM等操作的性能。还提及其他DSL工具与Triton扩展项目,并给出使用建议。
谷歌认领最强AI版Photoshop!现在人人可用,效果确实强悍
谷歌认领神秘图像编辑模型nano - banana,即Gemini 2.5 Flash Image。它可免费在Gemini和Google AI Studio使用,API收费。该模型图像编辑能力出色,能合并图片、实现2D到3D转换等,此前爆火却无官方文档。
Claude Code 究竟牛在哪里?(以及如何在你的 AI 智能体中复刻它的魔法!)
文章介绍Claude Code是出色的AI智能体,比Cursor等好用。它设计简单,提示词和工具弥补模型缺点。作者基于使用经验,给出打造类似智能体的要点,包括控制循环、提示词、工具和可引导性等方面。
可灵 2.1 首尾帧藏师傅外挂教程:两张图→大片,附万能提示词
作者分享可灵 2.1 首尾帧模型测试与使用教程,解决图片和提示词生成难题。介绍三种拿图法,给出 AI 生成提示词方法及原则,还指出可将流程固化、特效升维,提升视频创作效率与价值。
GPT-5 不是技术新范式,是 OpenAI 加速产品化的战略拐点
文章从不同视角评价 GPT - 5,指出它是 ChatGPT 产品重要升级,是 Router 驱动系统。介绍其能力提升与短板,如 Vibe coding 性价比高但 Agentic 能力不足,还探讨了商业影响、价格战等,期待其 Agentic 能力发展。