人工智能评估」共找到 1182 篇相关文章

产品应用8

告别复杂提示词!蚂蚁新方式让AI自动理解你的个性化需求

蚂蚁通用人工智能研究中心自然语言处理实验室提出AlignXplore方法,通过强化学习让AI从用户行为归纳偏好并动态更新。该方法训练分两阶段,支持流式偏好推断,实验表现优异,是大模型个性化新尝试。

量子位
新闻资讯7

解道奥赛题成本5000美元?陶哲轩警告,AI下一步要规模化的「更便宜」

谷歌新一代 Gemini 进阶版在 IMO 竞赛达金牌水平,华人数学家陶哲轩对此关注且担忧。他认为评估 AI 表现应谨慎,AI 发展需从定性转向定量,要‘降本增效’,未来标准化评测很重要。

机器之心
开源动态8

南洋理工、北大、上海AI实验室开源长记忆世界模型

目前世界模型模拟方法在维持长期一致性上有挑战,南洋理工大学、北京大学王选计算机技术研究所、上海人工智能实验室联合开源长记忆世界模型WORLDMEM,介绍了其记忆机制、基础架构、训练技术及检索策略等。

AIGC开放社区
新闻资讯7

OpenAI新Agent遭中国24人初创团队碾压!实测成本、质量全输惨,海外用户:中国Agent代差领先

昨日凌晨,OpenAI推出ChatGPT Agent新功能,标志其踏入“智能体人工智能”领域。虽官方称该功能性能先进,但实际效果有局限。海外网友对比发现,它被中国24人初创团队产品Genspark等碾压。

InfoQ
算法论文8

ICML 2025 Spotlight | 快手、南开联合提出模块化双工注意力机制,显著提升多模态大模型情感理解能力!

情智兼备是人工智能发展方向,但多模态情感数据语义复杂,建模跨模态关联是挑战。快手可灵团队与南开提出模块化双工注意力范式,构建‘摩达’模型,在多任务测试中性能提升,成果被 ICML 2025 收录。

AI前线
算法论文8

提升大模型内在透明度:无需外部模块实现高效监控与自发安全增强|上海AI Lab & 上交

大语言模型能力提升引发风险担忧,当前主流用外部“黑盒”监控模块解读模型表征,存在诸多局限。上海人工智能实验室和上海交通大学团队提出TELLME方法,摒弃外部模块,提升模型内部透明度,还提升了输出安全性。

量子位
新闻资讯7

Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光

苹果一篇质疑大模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力的方法。

新智元
推荐文章7

Anthropic的多智能体,真的有必要吗?

作者曾质疑多智能体系统,看了Anthropic对「Claude Research」的说明后有了改观。介绍了多智能体系统定义、性能提升、代价,还阐述构建方法、评估方式,公开三个核心提示词及协作模式。

AGI Hunt
新闻资讯8

5000次风暴,谷歌训出AI预言家!天气预报ChatGPT时刻?

谷歌DeepMind与谷歌研究团队推出交互式气象平台Weather Lab,共享人工智能天气模型。其新模型在热带气旋路径预测上刷新SOTA,是首个超越主流物理模型的AI预测模型,有望拯救数万生命。

新智元
算法论文8

知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳

东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。

量子位