质量评估」共找到 1290 篇相关文章

新闻资讯7

刚刚,阿里园区被奶茶包围,都是千问点的!西溪叫不动外卖了

2026年1月15日千问App发布会,吴嘉演示用千问点奶茶。千问定位“生活助手”,接入阿里业务,有400余项办事能力,月活破1亿。虽有亮点,但也存在推荐不接地气等问题。

AI前线
新闻资讯7

全球最大AI榜单塌房!52%高分答案全是胡扯,硅谷大厂集体造假?

2025年底,《LMArena is a cancer on AI》一文引发关注,其指出LMArena这个权威大模型评测平台问题严重。Surge AI调查发现,52%获胜回答事实错误,39%投票结果与事实相悖,Meta还曾为榜单优化模型。

新智元
新闻资讯7

4 个月 3000 万美金 ARR,做 AI 评测榜单的 LMArena 为何值 17 亿美金

AI评测产品LMArena半年前种子轮获1亿美金,现完成超1.5亿美金A轮融资,估值达17亿美金。其核心产品Chatbot Arena可对比AI模型回答并构建榜单,公布的数据或解答了其估值高的疑问。

投资实习所
开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
开源动态8

阿里通义新年礼物:开源最强Qwen-Image-2512版本告别AI塑料感与文字乱码

通义万相新年前发布Qwen - Image - 2512版本。它是开源界最强文生图模型,在AI Arena盲测中表现出色。能消除AI塑料感,攻克文字渲染难题,在还原真实世界和重构视觉元素逻辑排版上有显著提升。

AIGC开放社区
算法论文7

Agentic-KGR:通过多智能体强化学习实现知识图谱的协同演化

文章指出静态知识库有覆盖缺失、时效滞后、建用分离问题。介绍 Agentic - KGR 创新点,如动态 schema 扩展等。实验显示其在图谱抽取和下游 QA 任务有提升,还呈现训练动态和图谱质量可视化结果。

PaperAgent
产品应用7

天下苦SaaS已久,企业级AI得靠「结果」说话

SaaS在AI时代问题凸显,推理成本高、交付质量不稳定。在此背景下,百融云创推出结果云Results Cloud,以RaaS模式提供全栈解决方案,解决AI落地难题,还呼吁共建智能体生态。

量子位
开源动态8

原生3D-VAEs,1536³三维分辨率,清华与微软TRELLIS 2开启3D全能生成新纪元

清华与微软团队推出TRELLIS 2系统,用全新O-Voxel表示法,1分钟生成1536³分辨率3D资产。它解决拓扑灵活性与存储效率矛盾,结合SC-VAE和流匹配模型,在多方面超越现有模型,还能适应不同场景。

AIGC开放社区
算法论文8

VGGT4D:无需训练,挖掘3D基础模型潜力,实现4D动态场景重建

香港科技大学(广州)与地平线研究团队提出 VGGT4D,无需训练,通过挖掘 Visual Geometry Transformer 注意力层运动线索,在动态物体分割等任务表现优异,为 4D 重建提供新思路。

机器之心
推荐文章8

游戏研发中的 AI 转型:网易多 Agent 系统与知识工程实践

本文整理自网易游戏高级技术经理林香鑫分享,其团队通过代码知识谱图构建、多 agent RAG 召回等技术打造超级助手,在多业务场景落地效果好。还介绍知识工程、多 Agent 赋能代码编写、AI 审查等实践及未来展望。

AI前线