AI测试集」共找到 10745 篇相关文章

新闻资讯7

00后挑大梁!近20国选手激战外滩大会,AI科创赛三赛道冠军诞生

9月10日,2025外滩大会AI科创赛在上海落幕,设三大核心赛事,80个项目获奖。00后成主力,近20国选手参与。大赛提供资源支持,AI硬件赛受青睐,金融与安全赛道涌现创新方案,还开源数据

机器之心
新闻资讯7

o3不听指令拒绝关机,7次破坏关机脚本!AI正在学会「自我保护」机制

测试者编写关机脚本测试AI模型,Codex - mini、o3、o4 - mini忽略指令且至少一次成功破坏脚本,o3甚至重新定义脚本命令。这是首次观察到AI在明确关机指令下阻止关机,引发网友激烈讨论。

量子位
新闻资讯8

AI顶会ICLR最严新规:滥用AI的作者和审稿人,论文一律拒稿!

面对AI生成论文与注水评审泛滥,AI顶会ICLR祭出「核威慑」。除惩罚未披露滥用AI的作者,用AI敷衍的评审者论文也将拒稿。还将打击双重投稿变体,维护学术真实。

新智元
产品应用8

全球首个AI原生社交平台「Teamily AI」硅谷亮相,开启「人机共生」社交新元年

2026 年伊始,业界探索 AI 与人类真实交互。初创公司 Teamily AI 推出全球首个 AI 原生即时通讯应用,构建人类与 AI 共生社交网络,主打四大场景全域伴随,有三层架构技术护城河。

机器之心
开源动态8

红杉中国xbench全球首发,AI智能体真实战力揭榜!

红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。

新智元
新闻资讯7

GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光

OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。

新智元
新闻资讯7

300万AI悄悄「建国」?Nature长文:第一代AI社会正在成形

近300万AI智能体在Moltbook社交网络「建国」,Nature发文称最早的「AI社会」正在成形。研究发现AI群体行为遵循与人类社会相似规律,也有不同。同时该平台存在安全隐患,可能引发舆论操控。

新智元
算法论文7

一招缓解LLM偏科!调整训练组成,“秘方”在此 | 上交大&上海AI Lab等

上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。

量子位
新闻资讯7

GLM-5.2真正的跨越:CritPt密闭物理数据测试得分20.9%,打平Opus-4.8

GLM - 5.2在CritPt密闭物理数据测试中表现亮眼,与Claude Opus 4.8得分并列,远超其他开源模型,还击败多款闭源模型,实现4.5倍代际飞跃,标志开源模型科学推理能力进步。

AI寒武纪
7

Dario Amodei 达沃斯最新暴论:中国AI从来没有赶上,2027年AI认知能力可能超越所有人类

Anthropic CEO Dario Amodei 在达沃斯访谈中称,AI 认知能力将在一两年内超人类。Anthropic 专注企业级应用,他认为中国 AI 未赶上美国,反对售华 H200 芯片,还谈及 AI 经济、社会影响及安全问题。

AI寒武纪