「心理学实验」共找到 1308 篇相关文章
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
当AI成为预言家:大数据时代,我们正在失去理解世界的能力吗?
文章借神经科学家Grace Huckins观点,探讨AI时代人类理解世界能力问题。以‘微处理器论文’实验为例,指出大量数据未必带来理解。还阐述理解与预测分离、科学理解危机等,强调理解应是科学核心。
关于Nsight Compute中Compute Workload Analysis反映的Tensor Pipe Uti的理解
文章分析Nsight Compute中Compute Workload Analysis反映的Tensor Pipe Uti异常现象。通过实验和推算,发现ncu对L20 GPU上特定指令用错误执行延迟算指标,导致异常,还给出GEMM Kernel性能分析建议。
ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准
上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。
VLA 推理新范式!一致性模型 CEED-VLA 实现四倍加速!
近年来,VLA模型成机器人领域重要研究方向,但推理速度受限。本文提出一致性蒸馏训练、混合标签监督机制及提前退出解码策略,在多基线模型上实现超4倍推理加速,实验验证其高效通用。
AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%
大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。
微软再放LLM量化大招!原生4bit量化,成本暴减,性能几乎0损失
微软公布BitNet v2,性能几乎0损失,占用内存和计算成本显著降低。它首次实现对1比特LLMs的原生4比特激活值量化,通过H - BitLinear模块处理异常通道,实验显示其在多方面表现优异。
预测误差仅0.26mm,中科院自动化所×灵宝CASBOT团队让机器人提前“知道你要干嘛”
中科院自动化所与灵宝CASBOT提出DTRT方法获ICRA 2025录用。该方法利用Transformer和博弈论,将人类动态纳入长期预测,实验显示其预测精度和协作表现显著优于现有技术,有巨大应用潜力。
Arc研究所造出能“举一反三”的虚拟细胞模型,破解跨细胞预测难题
生物学和药物研发中,因细胞组合庞大,难以全实验验证,且同药在不同细胞效果不同。Arc Institute 团队推出虚拟细胞模型 STATE 及评测套件 Cell - Eval,STATE 预测效果优,但也存在短板。
AI for Science开始“动手”了:机器人正式走进国家级实验室
今年7月,国家级科研平台实验室迎来首批Monte2人形机器人,由源络科技与实验室联合研发。它能完成复杂实验操作,缓解人工瓶颈。全球自主实验室成趋势,源络发起“原点计划”推动AI for Science迈向实验室3.0。