大模型架构」共找到 9813 篇相关文章

算法论文8

ACL 2026|证据摊开看,场景图画清:让流式视频模型拿捏「何时开口」

随着多模态和语言模型发展,人类与 AI 交互走向共生。现有视频模型难把握响应时机,西北工业学等团队在 ACL 2026 提出 Response - G1 框架,实验显示其提升了模型性能。

机器之心
算法论文7

Fable5仅做对3.5%!模型会看图,但还没有主动视觉

本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。

机器之心
算法论文8

ICLR 2026|多模态模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
新闻资讯8

浙江学联合华为发布国内首个基于昇腾千卡算力平台的DeepSeek-R1-Safe基础模型

2025年9月18日,浙江学任奎教授团队联合华为在“华为全联接会2025”发布国内首个基于昇腾千卡算力平台的DeepSeek - R1 - Safe基础模型,提升了我国AI系统自主安全防控水平,任奎获“科研创新卓越贡献奖”。

AI大模型应用实践
算法论文8

AI画手总是六根手指?阿/美团/上交首次系统量化扩散模型计数幻觉

阿德莱德学、美团和上海交通学团队首次系统研究扩散模型“计数幻觉”问题。构建CountHalluSet数据集套件量化该问题,揭示其与采样条件的关系,还提出JDM模型缓解计数幻觉。

量子位
产品应用8

华为曝光两黑科技!打破推理延迟魔咒,模型从此「秒回」

华为通过FusionSpec和OptiQuant两技术创新,对MoE模型进行推理优化。FusionSpec依托昇腾特点,将投机推理框架耗时降至1ms;OptiQuant支持灵活量化,为模型推理提供高性价比。

新智元
算法论文8

模型人格可以被量化!Anthropic最新论文发现“辅助轴”,开辟人类控制AI全新道路

Anthropic等机构研究团队深入模型激活空间,发现模型人格可量化,存在“辅助轴”。沿此轴干预能预测、解释“人格漂移”,用“激活上限”技术稳定模型行为,抵御越狱攻击,开辟人类控制AI新道路。

AI寒武纪
产品应用7

AIGCode宿文:我就是要自训练模型,直接做「L5」| AI产品十人谈

AIGCode宿文坚信Coding是培育模型的最佳场景,公司自训练66B基础模型,发布锡月模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。

AI科技评论
新闻资讯8

双重突破:全球首个零售VLA模型来了!开源OpenWBT让机器人遥操门槛暴降!

2025北京智源会上,银河通用机器人展示端到端具身模型GroceryVLA,可在商超场景自主操作,具强适用性等五能力。还发布OpenWBT开源系统,降人形机器人遥操门槛,促产业发展。

量子位
产品应用8

豆包模型 Seed 2.0,有点不一样

模型升级频繁令人审美疲劳,但豆包模型Seed 2.0不同,其核心是Skills调用能力。作者测试了它做的小红书长图文排版生成器和古文翻译器,还体验了APP“专家模式”,展现多模态理解优势。

刘言飞语