「理论 - 实验学习范式」共找到 2541 篇相关文章
Kimi开源新线性注意力架构,首次超越全注意力模型,推理速度暴涨6倍
月之暗面发布开源Kimi Linear架构,用新注意力机制首次超越全注意力模型。长上下文任务中,它减少75%的KV缓存需求,推理加速达6倍。核心创新Kimi Delta Attention有细粒度遗忘门控等特点。
当 AI 下场炒 A 股,「推理」成了新的直觉
海外“AI Trading Battle”实验中,不同大模型交易表现差异大。港科大等团队提出RETuning方法,基于A股数据集验证,显著提升大模型金融预测准确率、推理可解释性,是综合改进方案,但有算力等局限。
拜拜了GUI!中科院团队“LLM友好”计算机使用接口来了
中科院软件所团队研究指出,现有LLM智能体成功率低、效率差的瓶颈在于GUI。其设计与LLM能力错配,团队提出声明式接口GOI,实现策略 - 机制分离,经测试性能提升显著。
腾讯发布SpecExit算法,无损压缩端到端加速2.5倍!解决大模型长思考效率难题
腾讯发布 SpecExit 算法,将思考早停与投机采样融合,利用轻量级草稿模型预测“退出信号”,在不引入额外探测开销的前提下,实现动态、可靠的思考早停,在 vLLM 上推理端到端加速 2.5 倍,准确性和推理效率得到双重保障。
BesiegeField:LLM能否学会设计机器?
香港中文大学推出基于游戏《Besiege》的测试平台BesiegeField,探讨LLM能否学会设计机器。研究通过组合式机器设计视角,测试LLM,提出多智能体迭代设计流程等,发现LLM有挑战但并非不可实现,如Gemini 2.5 Pro表现不错。
谢赛宁团队用RAE实现从8%到84%的飞跃,宣告VAE时代结束
谢赛宁团队用RAE新架构将ImageNet图像生成FID刷到1.13,宣告VAE组件过时。RAE结合先进表征学习成果与强大生成模型框架,解决诸多问题,还为其高维潜空间定制DiTDH架构,性能优异。
谷歌揭秘:Multi-Agent 推理时扩展才是未来。
谷歌DeepMind和MIT联合发表论文TUMIX,指出Multi - Agent是推理时扩展的最佳方式,以低成本大幅提升准确率。实验表明Agent多样性优于重复采样,还展示TUMIX机制、实战表现,且LLM能设计更强Agent。
清华万引教授:万倍加速催化剂设计,AI突破DFT瓶颈!
清华大学王笑楠团队提出催化剂设计新基础模型SurFF,发表于Nature Computational Science。它无需昂贵实验或耗时DFT计算,实现对金属间化合物表面暴露与形貌的高效、高精度预测,计算速度提升10⁵倍。
图灵得主Yoshua Bengio,开始警惕AI有意识了
图灵得主Yoshua Bengio和学生在Science发文探讨AI意识问题。文章未明确AI是否有意识,而是讨论科学界和公众信念的演变及把AI当有意识生命体的风险,还提及计算功能主义等相关理论。
大模型训练新突破!Meta提出LSP:无数据也能实现能力飞升
Meta提出语言自我博弈(LSP)方法,利用自我博弈框架让模型自我改进,不依赖额外数据。LSP赋予模型挑战者和解题者身份,引入GRPO和KL散度正则化技术,解决了大模型训练的数据依赖难题。