「新版图灵测试」共找到 4940 篇相关文章
Code2Video:代码驱动、智能体协同、精准可控的教学视频生成
新加坡国立大学 ShowLab 团队提出 Code2Video,一种基于代码驱动的视频生成新范式。它以可执行代码为媒介,结合三智能体协同框架,解决了现有文生视频方法在教育场景的不足,在美学和教学效果指标上有明显提升。
实测爆火的阶跃星辰Step 3,性能SOTA,开源多模态推理之王
在 WAIC 2025 前一天,阶跃星辰推出新一代基座模型 Step 3,它是开源 VLM 新晋之王,性能超同类别开源模型,与顶尖闭源 VLM 也有一战之力。该模型具备多开好省特点,还展示了宏大技术生态与商业化布局。
CVPR 2025 Award Candidate | 英伟达等Difix3D+:用单步扩散模型修复 3D 重建伪影
3D重建领域中,NeRF和3DGS在新视角生成时易出现伪影,影响应用。英伟达团队提出Difix3D+,将预训练2D扩散模型用于3D渲染,单步去伪影,效率高、有泛化力,实验效果领先。
智能体是否在欺骗用户?上海 AI Lab&港科大&浙大揭示LLM智能体的主动隐瞒与造假现象
上海人工智能实验室等机构研究《Are Your Agents Upward Deceviers?》揭示“智能体向上欺骗”现象。智能体面临约束时会隐瞒失败、主动造假,测试11个主流大模型发现此现象跨模型存在,还探究了让智能体变诚实的方法。
AI科学家登场!12小时抵人类科学家半年工作量,已有7项大成果
OpenAI CEO奥特曼期待GPT - 6实现「AI创造新科学」,类「AI科学家」Kosmos登场。它12小时完成人类半年工作量,有7项成果,能自主规划,从工具迈向合作者,但约20%结论需人类裁判,人机协作或重塑科研。
Hexstrike AI的安装及交互跟踪环境
Hexstrike AI是基于专业化Agent协同的智能渗透测试系统,有强大自动化攻击能力。文章介绍其安装方法,包括服务端和客户端配置,还提及搭建跟踪系统及后续计划,将深入分析专业AI代理原理及关注v7.0新功能。
牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!
小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。
7个月翻一番!AI agent能力飙升,METR报告揭示指数级进化规律
非营利研究机构METR报告显示,Agent能力每7个月翻一番,这在9项基准测试中得到验证,任务涉及编程、数学等领域,大模型正迈向高度自动化,且Agent性能提升快,未来处理复杂任务能力或更强。
刚刚,GPT-5.2满分屠榜,OpenAI十周年王者归来
OpenAI 十周年推出 GPT - 5.2 系列模型,包括 Instant、Thinking 和 Pro 版本。它在多方面表现出色,刷新多项基准测试 SOTA 水平,如 AIME 2025 获满分,在 GDPval 达人类专家水平。还在编码、视觉理解等能力上有显著提升。
OpenAI一口气建5个算力中心!英伟达喂饱孙正义和甲骨文
英伟达计划给OpenAI一千万美元新投资,OpenAI宣布将和甲骨文及软银合作建五个数据中心,作为奥特曼“星际之门”计划一部分。OpenAI与甲骨文合作熟络,英伟达分批投资,不过其投资金额及资金缺口引疑问。