「视觉设计」共找到 1887 篇相关文章
高效大规模创新3D重建模型iLRM
多数基于Transformer架构的模型处理多视图输入有可扩展性问题,成均馆大学、延世大学研究人员提出创新3D重建模型iLRM。它通过迭代细化机制生成3D高斯表示,有独特架构设计和高效注意力机制。
全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个
GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。
清华叉院教授手把手教你用强化学习训练智能体
在大模型智能体时代,智能体强化学习训练通用智能体很关键。ASearcher 是相关项目,AReaL 有交互次数和代码设计优势。本次吴翼教授将带团队成员,以多轮搜索智能体为例,教用最少代码实现训练。
Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66
来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。
95后北大校友挑起ChatGPT Agent大梁!今年刚博士毕业,曾获陶哲轩支持的AIMO第二名
OpenAI发布ChatGPT Agent项目,奥特曼重视有加,让两个华人挑大梁。孙之清从技术介绍强化学习训练,Casey Chu谈人类与Agent合作。孙之清是95后北大校友,Casey Chu领导过GPT - 4视觉输入原型开发。
超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型
现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。
1万tokens是检验长文本的新基准,超过后18款大模型集体失智
Chroma团队研究发现,将上下文扩展至1万tokens,18款主流大模型集体“失智”,“智商”非均匀下降,在一些节点会断崖式下跌。研究还设计四项对照实验,证明LLMs性能随输入长度增加显著且非均匀下降。
谷歌助力神经科学飞跃,破解斑马鱼全脑活动密码
谷歌等机构科学家联合发布开创性研究成果ZAPBench,这是预测斑马鱼全脑活动的基准测试平台。它含超70000个神经元4D光片显微镜记录,设计多种刺激条件采集数据,有特定基准测试任务和评估指标。
Anthropic:这样构建Agent,性能提升90%!
Anthropic分享从0到1构建多智能体DeepResearch系统的方法,该系统是Claude内置Research功能。干货多,涵盖架构设计、Prompt工程等。多智能体性能比单模型高90.2%,但烧钱,适合高价值复杂任务。
英伟达重返中国!6月大量生产特供AI芯片,价格暴降40%
路透社消息,英伟达为突破美出口限制,将为中国推特供AI芯片,6月量产,价格降40%。该芯片基于RTX Pro 6000D,简化设计以控成本和符合管制。虽计算力低,但CUDA生态有优势。