「大模型架构」共找到 9813 篇相关文章
AI遭遇灵魂拷问!这道题所有模型集体翻车,网友:我也不会啊
图像推理现新难题,在Reddit引发热议,目前无AI能真正解决。国内外支持图像输入的大模型答案不同,原因是对大立方体规格理解不同。结合提示多次尝试,部分大模型能找准方向,人类面对该问题也会困惑。
两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法
康奈尔大学团队提出面向大语言模型的类GAN训练框架PasoDoble,通过对抗训练两模型提升推理能力,不依赖外部监督,在多模型实验中显著提升数学基准表现,不过在部分领域外任务有局限。
工行x上交大发布多智能体研究成果,通过群体智能刷新翻译新高度!
2025年多智能体系统成大模型研发新高地。工行大数据和人工智能实验室与上海交大人工智能学院推出多智能体翻译系统TACTIC,以认知翻译学为指导,在相同模型配置下提升翻译效果,在小模型下提升更明显。
开源多模态大模型EarthMind,观测地球统一框架
地球观测数据复杂,现有多模态模型难适用。意大利、德国多所高校研究人员联合开源多模态大模型EarthMind,引入空间注意力提示模块,实现跨模态融合和多粒度理解,解决地球观测难题。
700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理
今年6月Sapient Intelligence提出的HRM影响大模型推理结构,四个月后三星研究员Alexia Jolicoeur - Martineau推出TRM,700万参数模型在推理基准测试中超越参数多10000倍的模型,还介绍了TRM原理、改进及实验结果。
8种LLM架构设计大比拼:从 DeepSeek-V3 到 Kimi K2,究竟有啥不同
文章对比了8种LLM架构设计,如DeepSeek-V3、OLMo 2等。介绍各模型关键技术,像DeepSeek-V3的多头潜在注意力和混合专家架构,还分析不同设计对性能、效率的影响,助读者了解LLM架构差异。
写Verilog、调CUDA,总翻车?工业代码大模型开始学会「先想后写」了
工业代码大模型缺的往往是‘想’的能力。北航联合多家单位提出的InCoder - 32B Thinking,让模型结合工业环境思考,通过ECoT从错误中学习,用ICWM提前预判结果,还能自适应思考深度,且模型与代码已开源。
Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布
Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。
知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳
东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。
Cursor“自研”模型套壳国产开源?网友:毕竟好用又便宜
美国顶流AI产品Cursor和Windsurf发布新模型,被指“套壳”中国开源大模型。Cursor新模型干活时说中文,Windsurf或用智谱GLM。中国开源模型物美价廉,在榜单和下载量上表现出色。