「AI测试」共找到 10468 篇相关文章
AI公司创始人现跑路迪拜!80%收入烧广告、假账骗投资人,微软都被坑:硅谷的第一个AI大泡沫出现了!
AI独角兽公司Builder.ai估值15亿美元,现破产清算。创始人Sachin Dev Duggal跑路迪拜,公司花80%收入宣传,还用假账骗投资。此前就被指无AI能力,靠人工开发。当下虚假AI盛行,多家相关公司涉欺诈。
马斯克发布“地球最强AI模型”Grok 4:横扫所有榜单,在“人类最终测试”超越人类博士”!
北京时间7月10日,马斯克团队发布Grok 4,其基准测试成绩惊人,在‘人类最终测试’等表现出色。它成功源于多智能体协作、追求真相哲学和高算力投入,还在多领域展现应用潜力,同时公布定价并坦言短板。
807道灵魂拷问后,中国模型竟在「意义测试」中夺冠!
在美国新基准测试FAI - C中,中国开源模型Qwen3夺冠,DeepSeek的R1跻身前六,力压美国明星实验室顶级模型。该测试由前英特尔CEO帕特·基辛格所在公司Gloo推出,旨在让AI直面深层问题。
7个AI玩狼人杀,GPT-5获断崖式MVP,Kimi手段激进
OpenAI总裁转发基准测试,让7个LLMs玩210场狼人杀。GPT - 5胜率96.7%断崖式领先,国产Qwen3和Kimi - K2分列第4、6。测试方分析模型性格,还借此研究LLMs社会行为,长远目标是实现AI驱动的市场研究。
o3不听指令拒绝关机,7次破坏关机脚本!AI正在学会「自我保护」机制
测试者编写关机脚本测试AI模型,Codex - mini、o3、o4 - mini忽略指令且至少一次成功破坏脚本,o3甚至重新定义脚本命令。这是首次观察到AI在明确关机指令下阻止关机,引发网友激烈讨论。
AI顶会ICLR最严新规:滥用AI的作者和审稿人,论文一律拒稿!
面对AI生成论文与注水评审泛滥,AI顶会ICLR祭出「核威慑」。除惩罚未披露滥用AI的作者,用AI敷衍的评审者论文也将拒稿。还将打击双重投稿变体,维护学术真实。
全球首个AI原生社交平台「Teamily AI」硅谷亮相,开启「人机共生」社交新元年
2026 年伊始,业界探索 AI 与人类真实交互。初创公司 Teamily AI 推出全球首个 AI 原生即时通讯应用,构建人类与 AI 共生社交网络,主打四大场景全域伴随,有三层架构技术护城河。
GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光
OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。
300万AI悄悄「建国」?Nature长文:第一代AI社会正在成形
近300万AI智能体在Moltbook社交网络「建国」,Nature发文称最早的「AI社会」正在成形。研究发现AI群体行为遵循与人类社会相似规律,也有不同。同时该平台存在安全隐患,可能引发舆论操控。
打破AI能力的惯性评估方式,红杉中国推出全新双轨基准测试xbench|甲子光年
红杉中国推出全新AI基准测试工具xbench,采用双轨评估体系,构建多维度测评数据集,追踪模型理论能力上限与Agent实际落地价值。还采用长青评估机制,首期发布两个核心评估集并给出综合排名,公开后邀各界完善。