「多模态推理大模型」共找到 8279 篇相关文章
模型合体!上交&上海AI Lab&华师提出LED-Merging,拒绝「能力」与「安全」二选一
上海人工智能实验室等团队提出LED - Merging解决模型融合“安全 - 效用冲突”问题。该方法无需训练,像“神经元手术刀”,不牺牲专业能力还提升安全性,论文已被ACL 2025 Main Conference接收。
杜克大学、Zoom推出LiveMCP‑101:GPT‑5表现最佳但未破60%,闭源模型Token效率对数规律引关注
杜克大学与Zoom研究者推出LiveMCP - 101,这是针对真实动态环境的MCP - enabled Agent评测基准。含101个任务,实验显示先进模型成功率低于60%,研究为提升Agent能力提供改进方向。
具身智能的「GPT时刻」?高德连发两个全面SOTA的ABot具身基座模型
过去几年,机器人行业面临模型与数据绑定特定场景、能力难以泛化的问题。近日,高德发布 ABot 系列具身基座模型,补齐行业能力缺口,标志具身智能从定制系统转向统一模型,有望降低开发门槛。
哈萨比斯出的难题,GPT之父接上了:用一个知识停在1930年的模型
GPT之父Alec Radford等用1931年前数据训练13B模型Talkie,切断现代知识污染。研究者测试其能力,探讨它对未来的“预感”、规避污染问题及数据多样性等,同时训练中也面临时间泄漏、数据质量等难题。
突发!微软与OpenAI同日开火:语音之战+通用大模型,AI霸权决战打响
OpenAI发布语音大模型时,微软同日推出自研语音模型MAI-Voice-1和通用模型MAI-1-preview。MAI-Voice-1效率高、表达丰富,MAI-1-preview采用MoE架构。微软此举在语音战场布局,也为与OpenAI谈判增加筹码。
老黄亲自站台,英伟达编程神器!Cursor 2.0自研模型狂飙4倍
Cursor 2.0版本重大升级,发布自研编码模型Composer,速度是同等模型4倍。还重构IDE交互逻辑,支持多智能体模式,引入语音模式等。早期测试和开发者反馈其速度快,但智能程度与部分模型有差距。
奖励模型终于迎来预训练新时代!上海AI Lab、复旦POLAR,开启Scaling新范式
在大语言模型后训练阶段,奖励模型设计与训练是关键瓶颈。上海AI Lab、复旦推出预训练奖励模型POLAR,采用策略判别学习新范式,适配强化微调,性能和泛化能力强,为LLM后训练带来新可能。
阿里通义发布并行计算新策略:1.6B等效4.4B,内存消耗骤降95%
阿里通义团队提出PARSCALE并行计算新策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型性能接近4.4B模型,内存占用大降,还可用于现有模型,无需从头训练。
AIGCode宿文:我就是要自训练大模型,直接做「L5」| AI产品十人谈
AIGCode宿文坚信Coding是培育大模型的最佳场景,公司自训练66B基础模型,发布锡月大模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。
华为中科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍
华为诺亚方舟实验室联合中科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。