「大模型测试」共找到 9855 篇相关文章
30余家单位确认加入,国内首部AI数据标注标准欢迎参与起草!
数据标注对AI产业重要,但行业合规问题突出。国内首部AI数据标注合规标准《面向人工智能的数据标注合规指南》已完成修订稿,正征集起草人/单位,聚焦5大关键合规议题,邀各方共解难题。
硅谷的企业级AI正在这样赚钱|2025人工智能现状报告
ICONIQ Capital发布的2025年人工智能现状报告聚焦企业级AI变现。报告基于对300名软件公司高管的调查,分析了模型选择、支出、工具使用等情况,指出AI产品战略进入新阶段,定价策略在重塑等。
完全免费!Claude Science开源平替,DeepSeek/GLM想用哪个用哪个
Anthropic发布面向科学家的AI工作平台Claude Science,能集成科研工具、多智能体协作等,但有系统、付费和模型使用限制。YC孵化团队推出开源平替OpenScience,不绑定模型厂商,功能更丰富且安装简单。
1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!
在文本转语音(TTS)领域,生成长篇、多说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。
西湖大学王东林团队论文:机器人需要“通古今,知未来”丨CVPR 2026
西湖大学王东林团队提出论文《HiF-VLA:Hindsight, Insight and Foresight for Vision-Language-Action Models》,介绍HiF-VLA模型,它以“运动”表达时间信息,实现稳定连续决策,性能提升且计算成本低,推动机器人从“看到就做”到“边想边做”。
20种机器人本体通吃!蚂蚁新一代VLA具身大脑刚刚开源了
2026 年具身智能 VLA 受关注,蚂蚁灵波发布新一代具身基座模型 LingBot-VLA 2.0,支持 20 种机器人构型,多方面能力提升,开源模型权重等,从架构、数据、后训练解决跨本体难题。
谷歌深夜放出「创世引擎」Genie 3!一句话秒生宇宙,终极模拟器觉醒
谷歌DeepMind推出通用世界模型Genie 3,能以每秒20 - 24帧速度实时生成720p画面,一句话即可生成动态世界,可模拟物理、自然等多种场景,但也存在有限动作空间等局限。
物理学家靠生物揭开AI创造力来源:起因竟是“技术缺陷”
两位物理学家以生物系统自我组装过程为参考,提出并验证假设:扩散模型去噪过程类似细胞分化重组,AI的‘创造力’是模型架构直接且必然的结果,本质是确定性过程。
答对了却没看图?EASE给多模态RLVR装上「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
数据集蒸馏,连发两篇顶会!10%样本实现全量性能,鲁棒不失真
数据集蒸馏能让模型高效节能,WMDD和GUARD两项研究分别解决保留原始数据特性、提升模型对抗扰动能力问题。WMDD用Wasserstein度量保留几何特性,GUARD平滑损失景观获对抗鲁棒性。