「通用大模型」共找到 9355 篇相关文章
「AI重大飞跃」OpenAI官宣:内部实验模型在IMO 2025中取得金牌,GPT-5即将发布
OpenAI研究员Alexander Wei宣布团队开发的内部推理模型在IMO 2025中获相当于人类金牌成绩,还透露GPT - 5即将发布。模型按人类规则评估,解决5个问题,代表AI通用推理能力飞跃,成果不局限于数学推理。
比自回归更灵活、比离散扩散更通用,首个纯Discrete Flow Matching多模态巨兽降临
近年来多模态大模型多采用自回归架构,推理缺乏灵活性。香港大学和华为诺亚方舟实验室研究团队提出FUDOKI,基于全新非掩码离散流匹配架构,能并行去噪、动态修正,为多模态模型开辟新路径。
云栖大会阿里掀桌子了!Qwen3-Max、VL、Omini、Agent ... 统统发布!
云栖大会上,阿里云智能首席技术官介绍千问多款新模型发布及一款升级。如万亿参数的Qwen3 - Max,代码和Agent能力强;还有Qwen3 - Coder - Plus、Qwen3 - VL、Qwen3 - Omni、Qwen3 - LiveTranslate等模型各有亮点。
DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了
过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。
DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!
DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。
万字长文|迈向电商大模型时代,从虚拟试穿聊到电商AIGC
本文是京东李岩博士在AICon2025的演讲整理。他从虚拟试穿切入,拆解其技术逻辑、行业实践与未来趋势,还介绍京东电商AIGC布局,如商品抠图、素材生成等能力,分享业务成果及对电商AIGC未来的看法。
刚刚,全球最难考试惊天大反转!黑马AI冲破36%,顶流模型集体翻车
ARC-AGI-3测试中,顶级大模型Opus 4.6仅得0.2%,人类获满分。而Symbolica公司用Agentica框架首日就取得36.08%的成绩。该框架有独特技术路径和策略,但成绩未经验证,ARC-AGI-3被视为通向AGI的‘北极星’。
为什么AI大厂的人,都跑去做生命科学了?
越来越多AI人才投身生命科学,创办数十亿美元估值公司。这是因训练通用模型门槛高,而生命科学技术可迁移、产业愿付费且有成功先例。新一代公司AI位置、融资、技术目标有变化,但仍面临数据和临床验证问题。
NUS、牛津等联合发布音视频智能综述:系统梳理大模型时代的AVI全景图
NUS领衔近10家机构发布音视频智能综述,系统梳理大模型时代AVI发展全貌,涵盖感知、生成与交互,复盘子方向工作,构建任务蓝图,整理评测体系,总结基础技术,还探讨应用、安全及未来研究方向。
比传统方法强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式
Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。