「AI评测」共找到 9833 篇相关文章
GPT-4V仅达Level-2?全球首个多模态通才段位排行榜发布,General-Level打造多模态通用AI评测新范式
General-Level团队提出全新评测框架General-Level和数据集General-Bench,构建超大规模评测基准和多模态通才模型排行榜。其用五级段位体系衡量模型通才能力,General-Bench覆盖多模态任务,排行榜分多层次榜单,目前各模型段位差异大,Level-5空缺。
中国AI登顶全球之巅,顶流女团MV燃爆开场!AI音乐奇点已至
昆仑天工发布Mureka V8音乐大模型,基于MusiCoT技术,在音乐性、人声表现力和编曲层次等方面显著提升,使AI音乐达「可发布」级别,评测超Suno V5,还与太合音乐合作,欲打造全球AI音乐第一平台。
从3632个漏洞看AI时代的评测基准重构!VulnGym基准发布
随着新一代漏洞检测工具出现,漏洞检测走向理解业务风险。腾讯悟空安全团队联合多机构发布 VulnGym 评测基准,基于真实漏洞构建,覆盖 400+ 漏洞路径,71.2% 为业务逻辑漏洞,支持确定性评测。
全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科
普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。
揭秘与评测 30K+ Star 的 Graphify:企业存量系统 AI 编码的"第二大脑"。
文章揭秘评测 30K+ Star 的 Graphify,它能将分散材料转为结构化知识图谱,助 AI 编程助手理解代码。介绍其使用方法、原理,经测试它能提升综合质量、降低探索成本,不过并非万能解药。
MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告
司南评测集社区 CompassHub 收录多维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论多模态/音频大模型相关议题。
构建企业级 AI 应用:为什么我们需要 AI 中间件?
9月26日云栖大会,阿里云资深技术专家林清山发布阿里云AI中间件,核心技术全面开源。文章指出2025年是Agentic AI爆发元年,分析AI原生应用架构变革,介绍阿里云AI中间件构成及优势,助力企业级AI应用落地。
AI Agents和Agentic AI有什么区别?
论文《AI Agents vs. Agentic AI》深入探讨AI Agent和Agentic AI的本质差异。AI Agents是集成大模型和外部工具的单体系统,适合简单任务;Agentic AI是多智能体协作新范式,适合复杂场景。还提及挑战、解决方案与未来方向。
吴恩达来信:AI Fund 如何培养 AI 构建者
吴恩达分享 AI Fund 培养 AI 构建者经验,非工程背景同事从‘AI Python 入门课程’学起,掌握构建模块,还列举他们构建的应用示例,鼓励更多团队让人人有能力用 AI 构建。
2025 的企业 AI 市场, Data &AI 占据主流视野
数据是 AI 模型学习和训练的基础,Data & AI 基础设施可打通数据与 AI 全链路。企业应用 AI 不应只关注算法和算力,还需重视私域数据。同时介绍了不同类型企业在 Data & AI 领域的特点及合作成本等内容。