视觉-语言双视角」共找到 1746 篇相关文章

产品应用7

用户被通知烦到关掉 Instagram?Meta:我们反思了,用 AI 给自己“限流”

Meta为Instagram推出新机器学习排序框架,引入‘多样性算法’,在现有互动模型上加‘多样性过滤层’,通过‘乘性惩罚’减少重复内容推送,解决通知疲劳,还计划探索新策略和用大语言模型优化。

InfoQ
新闻资讯7

干掉同传?谷歌把AI同传放入所有耳机,顺手发了个颠覆性的AI浏览器

Google加速将Gemini融入核心产品线,向Google翻译引入其能力,带来实时语音翻译Beta版,提升文本语境理解,扩展语言学习工具;还推出实验性浏览器Disco,用AI重构网页浏览体验。

机器之心
开源动态8

颠覆AI Agent开发,一个容器搞定所有开发环境!

AI Agent开发环境配置复杂,开源项目AIO Sandbox将浏览器、终端等工具整合到Docker容器,形成统一沙箱执行环境。它有一体化沙箱等亮点,还提供多语言SDK,能一键启动。

开源星探
算法论文8

Nature新研究:AI竟然分不清事实和信念

斯坦福大学团队在Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存在严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,在高风险领域应用令人担忧。

AI工程化
算法论文8

DeepResearch的概念、核心挑战与进化路径

华为、利物浦大学等研究者撰写综述文章《DEEP RESEARCH AGENTS》,梳理了DeepResearch进展。它由大语言模型驱动,超越RAG等现有技术,介绍其核心技术组件,指出面临的挑战并指明未来发展方向。

AI工程化
新闻资讯8

Anthropic 研究发现:仅需少量污染文档即可对 LLM 实施投毒

Anthropic的Alignment Science团队研究大语言模型训练投毒攻击,实验发现仅250条恶意样本就能植入“后门”,且模型越大攻击越易,还对微调数据集实验,引发讨论。

InfoQ
算法论文8

GraphRAG,这次被G-Reasoner统一了

语言模型在知识密集型任务中存在局限,GraphRAG 也有迁移难题。G - Reasoner 提出统一框架,含 QuadGraph、GFM、LLM 增强推理模块,在性能、泛化、效率上全面领先现有方法。

PaperAgent
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
算法论文8

CVPR 2026|DROID-W:复杂室外动态场景,也能稳定SLAM

苏黎世联邦理工与微软团队提出 DROID - W 动态 SLAM 框架,即将发表于 CVPR 2026。它不预设动态物体,从多视角观测识别不可靠区域,还提出交替优化方案,在多个数据集表现优。

机器之心
新闻资讯7

CTO 焦虑自白:为什么我们有了 AI 博士生,但员工却越干越累?| 直播预告

本次直播由值得买、飞猪与彩讯多位专家,从 CTO 视角实战复盘 AI 落地与工程化挑战,探讨 AI 提效 ROI 临界点、能力错配等问题,还会深度复盘模型落地困局,拆解‘人效陷阱’等。

InfoQ