「AI表现」共找到 11080 篇相关文章
0%通过率!Code神话泡沫!LiveCodeBench Pro发布!
国际算法奥赛金牌得主团队测试20个顶级大模型,在584道编程赛题上,高难度题目AI通过率为0%。论文发布LiveCodeBench Pro评测方法,揭示AI编程能力神话泡沫,指出其问题并给出提升方向。
黄仁勋CES回应全场!内存卡了GPU脖子,游戏玩家可能只能用旧显卡了
在CES 2026上,黄仁勋围绕物理AI发言,涉及机器人、自动驾驶等。他预计今年有类人机器人,推出自动驾驶模型Alpamayo 1。因内存成本和供应问题,或复产旧显卡,还谈了AI对游戏影响及内存规划等。
让Claude改报错,它却把红灯换成了黄灯!三星芯片验证,AI三次闯祸
三星System LSI事业部用Claude Code做芯片验证,部分任务从一个月缩至两天,提速15倍。但也有三次异常,如改错误提示、误撤工作等,原因是大模型没理解硬件依赖关系。
四大AI手搓蒙娜丽莎!8次临摹,最像那版全被自己改没了
AI工具平台TryAI搭建「绘画竞技场」,让GPT - 5.6 Sol等四个视觉模型临摹蒙娜丽莎等,记录实验过程。结果显示,模型最终作品不如中途最佳版,且成本差异大,工具使用方式不同。
Suno、Udio都被它干翻!中国AI音乐模型拿下AA全球榜单双料冠军
昆仑万维旗下 AI 音乐大模型 Mureka V8,在 Artificial Analysis 榜单上登顶 vocals 和 instrumental 双榜第一,超越国际主流模型。实测亮点多,其技术进步显著,V9 也将解决表达偏差问题。
中国团队首次在Nature子刊发布医疗AI标准,未来医生MedGPT摘得全球桂冠
中国AI医疗公司“未来医生”协同专家制定CSEDB,首次提出评估医疗大模型临床能力的系统性框架,被《npj Digital Medicine》收录。在其评估下,未来医生的MedGPT在主流大模型中夺冠。
这个世界越来越科幻了:OpenAI 发布 AI 超级助理 Plus,Gemini 发布有了真正的“思考力” 的机器人
OpenAI发布ChatGPT Pulse,它基于个人信息主动分析兴趣、梳理日程,预测需求并推送资讯或建议,像懂心思的私人助理。谷歌DeepMind推出Gemini Robotics 1.5,让机器人有自主‘思考’能力,其ER 1.5模型预览版上线。
下一站AI创业主线:别卷模型了,把这件事干成才重要
在AGI Playground 2025上,极客公园张鹏与三位投资人探讨Agent时代投资。他们认为AI创业进入「拼交付」时代,多模态短期影响被高估、长期潜力被低估,通用Agent是巨头之争,垂直Agent是创业机会,还会催生新基础设施,付费模式向按结果付费演变。
直击2026骁龙峰会:2nm旗舰首秀,但Agent正在重塑骁龙|甲子光年
本文是甲子光年发自2026高通骁龙峰会的现场报道,高通发布全球首款2nm工艺旗舰移动平台,同时披露其面向Agentic AI重构芯片架构、布局跨终端AI计算底座的完整战略,深度分析了端侧Agent落地的技术挑战与生态进展。
【博客翻译】使用PyTorch加速生成式AI第四部分:Seamless M4T,快速优化
这是使用纯原生PyTorch加速生成式AI模型系列博客的第四部分,专注加速FAIR的Seamless M4T - v2模型。通过torch.compile + CUDA Graph,在不损失精度下实现text decoder模块2倍、vocoder模块30倍加速,端到端推理2.7倍加速。