「四段式预训练」共找到 2350 篇相关文章
谷歌新模型登顶Nature,人类基因密码被解码
谷歌推出全新AI工具AlphaGenome,能精准预测人类DNA序列变异对调控基因生物过程的影响。它满足多项条件,在26个变异效应benchmark中25个达SOTA,还通过多个案例和实验验证了其性能。
SmartSearch:奖励驱动query精炼,让Agent中的RAG会“改错”
现有LLM搜索Agent忽视‘如何提问’致答案易出错。SmartSearch提出‘过程奖励+查询精炼’双机制,让Agent学会‘写不好就改’,代码已开源。经实验,它在六数据集全面领先,各机制缺一不可。
“心内推理”:一种动态多模态潜在空间推理范式 | 直播预约
当前多模态大模型推理效率低、稳定性不足。本次分享将介绍DMLR,它无需额外训练,仅在推理阶段生效,通过在潜空间优化潜在思考token、引入关键视觉信息,实现高效稳定的多模态推理。
王小川:30亿现金在手,明年IPO,toC产品马上就发
百川智能CEO王小川明确发展主线,百川开源新一代医疗大模型Baichuan-M3,在医疗评测中表现优异。公司约30亿资金,预计2027年IPO,今年将发两款to C医疗产品,重点在院外诊疗。
注意力机制大变革?Bengio团队找到了一种超越Transformer的硬件对齐方案
Transformer虽改变世界但不完美,线性递归等新方法理论有优势,实际在GPU表现不佳。Bengio团队提出硬件对齐算法框架,用滑动窗口循环和B2P算法,实验显示有速度与质量双重突破。
Ilya重新定义AGI: 为什么ChatGPT离真正的AGI还很远
OpenAI前首席科学家Ilya在访谈中提出对AGI的新定义,还指出AI规模时代结束,未来拼想法和研究深度。他分析模型评测强但经济影响弱的原因,阐述人类价值函数作用,且SSI战略或调整。
用企业级智能体落地,还有谁没踩这四种大坑?无问芯穹的系统性解法来了
企业级智能体落地遇效果、稳定、成本和商业闭环四大难题,无问芯穹推出智能体服务平台,从多方面提供解决方案,并展示SysCoding Agent案例,其基础设施或成企业拉开差距关键。
性能不减,吞吐量提升6.4倍!英伟达用混合算子和架构定义小模型新标准
NVIDIA研究团队通过Nemotron - Flash系列模型,打破对‘深而瘦’架构迷信,修正缩放定律,用进化算法搜索混合算子、改进训练策略。该模型在性能、延迟和吞吐量上表现出色,远超同类产品。
Snapchat提出Canvas-to-Image:一张画布集成 ID、姿态与布局
Canvas-to-Image 是面向组合式图像创作的全新框架,将不同控制信息整合在同一画布,简化图像生成控制流程。它解决了传统生成流程中控制方式分散的问题,能在推理阶段组合多种控制信号,实验效果良好。
沉默的进化:LatentMAS 如何通过“潜意识通信”重塑多智能体协作?
这是对多智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。