「南洋理工大学 S-Lab 团队」共找到 3837 篇相关文章
只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026
多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。
让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26
多模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为多模态助手落地提供实用路径。
CVPR 2026 | 让AI视频不再「串戏」:免训练精准控制多段动作,SwitchCraft一招破解逻辑崩坏
随着文本到视频扩散模型发展,AI视频生成有进展,但开源模型处理多事件提示词时存在技术瓶颈。西湖大学团队提出免训练框架SwitchCraft,引入注意力控制机制,入选CVPR 2026,代码已开源。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。
Skills刚火,就有零Skill的Agent来了…
Skills爆火之际,云玦科技团队提出不用Skills的零Skill Agent。它以Gemini 3 Pro为后端,在多个评测集表现出色。采用原位自进化框架,开源且成本低,或助力开源模型弯道超车。
Thinking Machines再发文:模块化流形让训练更稳定
Mira Murati团队分享神经网络训练推理新研究,提出“模块化流形”让训练更稳定。将权重约束在Stiefel流形,设计Manifold Muon优化器,实验显示效果好,但计算开销和理论问题待解决,代码已开源。
智能体的致命三要素及六种安全设计模式
智能体发展带来诸多安全问题,仅靠外部防护不合理。Simon Willison总结其致命三要素,指出间接提示词注入攻击难防。Invariant Labs等提出六种安全设计模式,可综合使用,多LLM方法值得关注。
刷新无监督异常检测上限!首提「匹配代价滤波for异常检测」范式 | ICML'25
新智元报道,东北大学等团队在ICML 2025提出CostFilter-AD,将「匹配代价体滤波」引入无监督异常检测,构建异常代价体并滤波,无需缺陷样本训练,可作插件提升现有系统,精准检测微小缺陷。
Grok 4意外提前曝光,xAI巨额融资700亿,马斯克宣布“重写人类知识库”
xAI的Grok 4提前泄露,团队跳过Grok 3.5直接推出。它被定位为旗舰模型,有强大性能。马斯克欲用其重写人类知识库,但引发争议。xAI融资100亿,建超算中心面临电力问题。
这个扩散LLM太快了!没有「请稍后」,实测倍速于Gemini 2.5 Flash
AI初创公司Inception Labs推出首款专为聊天定制的商业级扩散LLM——Mercury。它速度超快、效率高,能实时响应对话。实测显示其速度优于Gemini 2.5 Flash等,不过生成质量有待提升。