「日日新6.5」共找到 5446 篇相关文章
大模型训练的不稳定性有望彻底解决,MIT新研究用谱正则化替代层归一化
MIT团队创造Lipschitz Transformer,用谱正则化替代层归一化,认为或解决训练不稳定根本原因。他们对比多种方法权衡,发现Muon + 奇异值裁剪推动权衡边界,且工作完全开源。
别跟LLM太交心!斯坦福新研究:AI不能完全取代人类心理治疗师
斯坦福大学研究团队测试流行AI模型及商业化AI治疗平台,发现AI治疗师存在根本缺陷与潜在危险,如歧视回应、无法危机干预、谄媚等,但也认可其在心理健康方面的辅助用途。
杨植麟被梁文锋叫醒了!Kimi新模型发布即开源,1T参数全线SOTA
172天后,Kimi推出全新Kimi K2基础大模型回应DeepSeek冲击。它为MoE架构,1T参数,激活参数32B,在多任务上领先,发布即开源,还分享技术细节,实测有亮点也待优化,展现回归之势。
中科院“二氧化碳制糖”新成果全网热议!不依赖光合作用,“迈向深空前置技术”
中国科学院天津工业生物技术研究所提出新技术,首次构建体外转化系统,打通“CO₂→甲醇→蔗糖”合成路径。绕过植物光合作用制糖,能耗低、效率高,对解决全球变暖、粮食危机有启发。
亿点点新融资砸向具身智能:斯坦福华人团队,首创“自适应机器人”品类
具身智能火热,非夕科技完成C轮亿级美元融资,由咏归基金、广发信德联合领投。该公司由斯坦福大学相关成员创立,首创“自适应机器人”品类,此轮资金用于扩产、研发及生态拓展。
逐个token太慢!大模型原生并行出token,CMU、英伟达新作Multiverse
卡耐基梅隆大学(CMU)和英伟达研究者提出Multiverse,这是能实现原生并行生成的新型生成模型。它解决了现有并行生成模型缺乏连贯性等问题,通过多方面协同设计构建推理模型,还开源了生态系统。
年入6亿、日本细分赛道第一,国产AI 硬件如何拿下日本智能家居市场?
国产 AI 硬件 SwitchBot 拿下日本智能家居市场市占第一。它单价低、安装灵活,以“非入侵式后装”理念,从智能开关拓展到多品类。2023 年扫地机器人 K10+ 大获成功,后又用 S10 试水美国市场,还推出 K20+ Pro 拓展场景。
刚刚,OpenAI最强推理模型o3-pro诞生!碾压Gemini 2.5 Pro击穿底价
OpenAI昨夜官宣上线最强推理模型o3 - pro,还将o3价格暴降80%。o3 - pro专为深度思考和提供超可靠答案而生,在多项测试中表现优异,虽有速度慢等限制,但优势明显,网友实测效果惊艳。
推理“刹不住车”?新框架让DeepSeek-R1们告别过度思考,已开源
DeepSeek - R1等推理模型能力增强,但出现过度思考问题,如步骤繁冗、表述拖沓、输出冗长。浙大等团队提出Self - Braking Tuning(SBT)框架,能让模型适时终止推理,在多数据集测试中效果显著。
爆火论文颠覆RL认知!「错误奖励」让LLM推理暴涨24.6%,学界惊了
最新爆火论文颠覆传统RL训练认知,华盛顿大学等团队证实「伪奖励」可让LLM推理性能提升。研究设置多种伪奖励形式实验,发现其对Qwen模型有效,但并非对所有模型都有效。