小模型推理」共找到 8536 篇相关文章

算法论文8

何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升

何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。

量子位
开源动态8

3B模型性能钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学

上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。

量子位
产品应用7

jiSGLang集成ktransformers:2TB内存运行Kimi K2 Thinking模型

对于内存多但GPU资源有限的用户,SGLang集成ktransformers的CPU内核,支持直接运行Kimi K2 Thinking模型。它无需等量化,还能微调,虽性能与GPU方案有差距,但给用户新选择。

AI工程化
算法论文8

让机器人在“想象”中学习世界的模型来了!PI联创课题组&清华陈建宇团队联合出品

斯坦福Chelsea Finn课题组与清华陈建宇团队联合提出可控生成世界模型Ctrl - World,可让机器人在“想象空间”预演任务。该模型使用零真机数据,提升下游任务指令跟随成功率。其相关论文已发布于arXiv平台。

量子位
算法论文8

世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

Aether AI与加州大学圣地亚哥分校研究发现现有世界模型会无视动作控制信号,根源是隐动作模型受视觉混杂因素污染。团队提出CD - LAM,从上游净化隐动作表征,实验显示其能降动作误差、提画面质量,降低后训练开销。

机器之心
产品应用8

微软深夜发布SambaY架构,Phi-4min加速10倍推理

微软基于Phi - 4 - mini微调出Phi - 4 - mini - Flash - Reasoning 3B模型,扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行速度比前代快10倍,有诸多优点。

CourseAI
新闻资讯7

模型一年内就会吞噬 Harness!Google AI Studio负责人:深耕垂直领域才是创业公司唯一生路

Google AI Studio负责人Logan认为,大模型一年内将吞噬Harness,90%的Agent中间件公司最多存活12个月。创业公司应深耕垂直领域,Google用Anti - Gravity平台串联产品,推动智能体发展,且模型后训练潜力巨大。

AI科技大本营
开源动态8

告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

当前大语言模型在长周期任务中,长时持久记忆管理陷入“精度不够”和“成本太高”的两难困境。中国人民大学团队提出MemSifter框架,将记忆检索工作外包给轻量级代理模型,在8个权威测试中超越现有方案,且已开源。

PaperAgent
产品应用8

捅破具身智能天花板!极佳视界新VLA大模型登场,复杂长时程任务近100%成功率

极佳视界推出GigaBrain-0.5M*VLA大模型,以世界模型条件驱动,引入人在回路持续学习机制。在与主流方法对比中,任务成功率提升30%,长时程任务近100%成功,还具备高效准确的价值预测能力。

量子位
算法论文8

AIAA J | 香港理工大学王旭等:目标导向的特征提取-以特征构建增强数据驱动模型

该论文通过对比学习理清潜在输入特征与目标输出的关联性,提出输出驱动的输入特征构造方法。所构造特征在高维代理模型构建中增强效果显著,还可减少预测误差分布及不同模型收敛性和鲁棒性差异。

力学与人工智能