同质化评估」共找到 1448 篇相关文章

算法论文8

准确率腰斩!大模型视觉能力一出日常生活就「失灵」

EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。

量子位
新闻资讯7

「2025中国科技产业投资榜」榜单揭晓|甲子引力

2025甲子引力年终盛典在北京举办,现场发布【2025中国科技产业投资榜】,呈现投资机构卓越表现。2025年全球资本市场复苏,中国科技产业迈入关键阶段,投资具‘硬科技主导、长期主义、生态布局’特征。

甲子光年
新闻资讯7

CTO 焦虑自白:为什么我们有了 AI 博士生,但员工却越干越累?| 直播预告

本次直播由值得买、飞猪与彩讯多位专家,从 CTO 视角实战复盘 AI 落地与工程挑战,探讨 AI 提效 ROI 临界点、能力错配、数据投喂等问题,还会深度复盘模型落地困局等。

AI前线
产品应用8

360发布全球最强视觉语言对齐模型!榜单全面领先!

360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。

AIGC开放社区
新闻资讯7

Groupe SNCF 使用 Talos OS 和 Kubernetes 实现基础设施的现代

法国国家铁路集团(Groupe SNCF)从传统 VM 的 Kubernetes 部署迁移到基于 Talos OS 和 OpenStack 的云原生平台,解决运维挑战。虽面临组织和技术难题,但紧密合作加强了平台,未来将扩展平台、迁移关键应用。

InfoQ
算法论文8

大模型是否对问题难度有预判?最新研究揭示 LLM 内部的“难度感知机制”

近期论文《Probing the Difficulty Perception Mechanism of Large Language Models》系统性解答大模型能否感知问题难度等问题。研究基于数据集在主流 LLM 上训练轻量线性探针,定位负责难度感知的注意力头,还发现不同模型表现有差异。

深度学习自然语言处理
开源动态7

打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集

苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。

机器之心
新闻资讯8

能懂孩子、懂爸妈、还懂宠物,这届AI硬件太会了

在AI终端生态大会上,荣耀携手伙伴展示AI新用法,发布八大AI场景生态解决方案,覆盖多高频场景。其构建的AI生态网让AI从‘能用’到‘好用’,还重新定义硬件与人的关系,让AI更懂生活。

量子位
产品应用8

挑战Claude code和Cursor:阿里Qoder对标全球,AI编程迎来“上下文”革命

AI编程工具爆发式增长,‘上下文’成实用难题。阿里推出Qoder平台,结合大模型与Agent,可深度检索代码、理解上下文。本文采访Qoder团队工程师,解析其定位、成本、技术路线等关键问题。

InfoQ
新闻资讯8

Uber&WisdomAI揭露95%AI Agent落地失败的真相 !

在‘Beyond the Prompt’技术论坛上,Uber、WisdomAI等企业揭开AI智能体落地难症结。指出90%失败源于‘喂错料’,信任是落地‘生死线’,记忆是架构设计,多模型编排与场景交互决定用户体验上限。

CourseAI