「多视角预测」共找到 4547 篇相关文章
谷歌Deep Think八语奥赛屠榜!自主攻克4大未解难题,科研壁垒崩塌
谷歌Deep Think横扫亚欧多语种竞赛,成绩亮眼。虽评测数据来自内部,未公开细节且是区域赛,但它定位为‘人类智力倍增器’,其驱动的Aletheia已产出论文,解决4个未解问题,在多领域展现潜力。
自适应Agent基础模型:从“会推理/会用工具”到“懂得取舍的执行者”
当前大型语言模型在智能体/工具调用场景有推理型和工具型两类,存在效率与功能、深度的矛盾。A²FM框架提出多模式自适应路由,实现模式自适应切换,在多基准测试中效果与效率双升。
大模型结构化推理优势难复制到垂直领域!最新法律AI评估标准来了,抱抱脸评测集趋势第一
多个机构研究人员联合发布全新多语言法律推理基准数据集LEXam,它含4886道题,每道长篇题有答案和推理路径。研究显示现有大模型应对法律推理难,LEXam引入评估新模式,还对不同模型做了测试。
Win11 已近乎“残废”?微软承认多个核心功能崩盘,锅要甩给 AI 编程吗?
近期微软麻烦不断,先是部分Microsoft 365服务故障,Windows业务负责人公布的计划也遭不满。英伟达指出Windows 11更新影响游戏效能,微软承认其存在系统性问题,多个核心功能故障已持续四个月,官方正修复并给出临时方案,引发社区吐槽。
AI陪伴Top 1应用上线视频生成!图片人物能说话唱歌,多轮对话场景依然稳定
AI陪伴应用Top 1的Character.ai(c.ai)上线视频生成功能AvatarFX,可让静态图片人物“开口说话”。c.ai还上新多项AI创作功能。此外,谷歌收购c.ai遭美国反垄断调查。
4K-Agent:可将低分辨率图像提升至4K高清智能体
图像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率图像提至4K高清,在多领域测试表现出色。
CVPR 2026 | 1B模型也能当多镜头导演?大连理工&快手可灵开源力作MultiShotMaster
大连理工与快手可灵团队推出MultiShotMaster框架,能在1B左右小参数量级模型实现导演级镜头调度和连贯叙事,支持多图参考、主体运动控制。论文录用至CVPR 2026,代码已开源,还获AAAI CVM Workshop竞赛冠军。
他们在1993年就提出了Scaling Law
原来,Scaling Law在32年前就被提出了,不是2020年的OpenAI、不是2017年的百度,而是1993年的贝尔实验室。在一篇文章里提出一种预测方法,研究人员可以预测模型在更大数据集上的表现,这和现在大家常提的Scaling Law几乎一致。
不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine
UC伯克利大学副教授Sergey Levine提出,为何语言模型从预测下一词中学到很多,视频模型从预测下一帧却学得少。他指出LLM可“抄近路”模仿人类推理,像在“柏拉图洞穴”中,还探讨了AI走出困境的方法。
知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳
东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。