「学科评价体系」共找到 766 篇相关文章
AI卷到物理世界,小米迎来自己的主场?
该文探讨小米在物理AI领域的发展。物理AI与生成式AI有别,更重感知与执行。小米有手机、汽车、家庭入口,补齐多样能力,成全球首个在「人车家全生态」落地物理AI的公司,优势显著。
DeepMind华人研究员Lun Wang离职,「评估」成制约模型能力飞跃的瓶颈
谷歌DeepMind研究员Lun Wang离职后发文指出,当下评估体系难以应对新模型,制约模型能力飞跃。现有评估多针对当前模型,新能力出现时往往无法预测,需构建能自我进化的评估系统。
奥特曼趁马斯克出差爆猛料:他曾想让子女继承OpenAI
趁马斯克出差,奥特曼在“OpenAI果实窃取诉讼案”庭审爆料,称马斯克曾想让子女继承OpenAI,还想将其并入特斯拉。奥特曼否认OpenAI背叛初心,称马斯克早已知情且曾支持探索营利模式。
你的「龙虾」真记得你吗?剑桥发布长期个性化记忆基准ATM-Bench
剑桥大学团队开源面向AI个人助理的长期记忆基准测试ATM - Bench,评估AI面对真实生活数据时能否「记住你」。实验结果不佳,专用和通用智能体系统准确率低,凸显长期个性化记忆问答难题。
龙虾的应用商店挂牌了!北大开源MagicSkills,让Agent Skill可自由安装组合同步
北京大学Narwhal - Lab开源项目MagicSkills,把AI Agent所需技能统一管理,实现能力复用。它解决了技能管理分散、重复等问题,提供共享体系,让技能可安装、组合、同步和调用,适用于多Agent项目等。
港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026
扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。
智谱 AutoClaw 深度测评:一键把电脑变成 AI Agent,是神器还是半成品?
本文深度测评智谱最新推出的桌面应用AutoClaw。它宣传能让电脑成AI Agent,引发两极评价。文章从安装、界面、功能、成本等方面测评,指出其优缺点,认为虽不完美但方向值得肯定。
刚刚,Anthropic 发布 Claude「宪法」:一份写给 AI 的人生指南
Anthropic 公开给 Claude 写的数万字「宪法」,从「规则清单」升级为「价值体系」,设定四个核心价值,有「聪明朋友」理论,设硬性限制,对诚实要求严格,还探讨意识等问题,强调透明度和持续进化。
阿里 Qwen3-TTS 全新上线!支持9种方言+49种音色,连天津味儿都拿捏了!
阿里通义团队上新 Qwen3-TTS 文本转语音模型,主打拟人语音表达、丰富音色体系与多语言多方言能力。有 49 种高保真音色,支持 10 种语言、9 种方言,还能智能调节语速和韵律。
传感器技术如何赋能船舶?
本文介绍船舶传感器技术,其是衡量船舶工业竞争力的关键。阐述了传感器在船舶各系统的应用、分类、工作原理、安装场景,指出我国产业在规模扩大同时存在短板,还探讨了未来升级方向、应用拓展及产业创新路径。