「视觉知识」共找到 1118 篇相关文章
假设 AI 未来真的能在写代码和系统设计上超过人类,那还有必要学习编程和系统设计吗?
文章围绕AI未来在编程和系统设计上能否超人类展开探讨。分析AI编程效率未达预期的原因,指出短期内不会有完全面向AI的软件架构,还强调学习编程和系统设计知识可培养解决问题的能力。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
多模态后训练反常识:长思维链SFT和RL的协同困境
华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。
顶级邪修再战 Nano Banana Pro ,超多玩法,太猛了这玩意!
谷歌发布 Nano Banana Pro 模型,将图片模型能力推向顶峰,支持中文。它能生成准确视觉内容、多语言文本,可混合多元素,支持多分辨率。经测试,其各方面表现出色,应用场景丰富,版权限制宽松,三方应用和谷歌官方均可使用。
跟不上、读不完?上万篇顶会论文,这个工具一键分析
加州大学圣迭戈分校等机构开发 Real Deep Research(RDR)系统,可自动完成领域综述与趋势追踪。它从顶会收集论文,压缩成摘要并聚类,还能生成综述、绘制趋势图谱。与已有方法不同,它结合自动化与专家知识。
清华等发布UltraRAG 2.0,仅用50行代码解锁RAG高性能开发
大语言模型存在“知识截止”问题,RAG技术应运而生,成为大模型落地主流方案。但随着需求提升,其工程实现变复杂。清华等推出UltraRAG 2.0,仅50行代码实现同等功能,降低开发门槛,性能提升,还能落地多种场景。
Claude Opus 4.7发布!这是你在别的公众号看不到的五个发现
Anthropic发布Claude Opus 4.7,编码和视觉能力提升,但长上下文能力下降。其231页的System Card藏着不少有趣发现,如Opus 4.7非最强模型、Claude知道被测试、模型审查自身评估等。
除了prompting外,不动参数,如何改变模型行为?
文章指出传统提示工程控制大模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏自编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理长度。
揭秘!腾讯如何训练多智能体像专家一样设计游戏场景
腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用图像引导生成3D场景。它构建多智能体工作流,结合高质量数据集,经模型微调、视觉解析等步骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开
上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。