「无预训练模型」共找到 8413 篇相关文章
本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B大模型
文章围绕本地大语言模型(LLM)展开,针对实用性和经济性问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型、推理框架等,给出不同配置下性能指标及使用建议,还模拟真实场景测试。
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。
刚刚,国产Agent模型闯入全球第一梯队!限时免费
昆仑万维发布SkyClaw-v1.0及其轻量版SkyClaw-v1.0-lite Agent模型,性能达全球第一梯队,价格仅主流顶尖模型一半甚至更低,适配主流Agent框架,还兼容OpenAI接口,现限时免费,后续将逐步开源。
数千大模型全跑「中国芯」!最后一公里已「焊」通
国产芯片运行大模型需额外适配,魔乐社区以开源模型推理适配协作模式破局。它推出‘模型推理适配协作计划’,联合多方力量,打通国产算力与大模型应用‘最后一公里’,还举办赛事激发创新活力。
模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞
上海人工智能实验室与香港中文大学研究团队发布论文,用MathIF基准揭示大模型“聪明”和“听话”有矛盾,越擅长推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。
图灵奖得主LeCun最后警告Meta!我搞了40年AI,大模型是死路
图灵奖得主Yann LeCun预计将很快离开Meta。因Meta风向转变,LeCun失势。他投身AI研究40年,认为大语言模型是死路,世界模型才是未来,或为此离开Meta并计划创业。
「Next-Token」范式改变!刚刚,强化学习预训练来了
微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。
Meta刚刚开源DINOv3,横扫60+任务,无标注封神!
今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。
让LLM扔块石头,它居然造了个投石机
港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。
CVPR2026 | Streamo:让大模型变成实时流式交互助手
香港浸会大学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端到端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。