循环模型」共找到 7750 篇相关文章

开源动态8

6.1B打平40B Dense模型,蚂蚁开源最新MoE模型Ling-flash-2.0

蚂蚁百灵大模型团队开源 MoE 大模型 Ling-flash-2.0,其以轻量级配置展现卓越性能,在推理速度、任务性能、部署成本间找到新平衡,为大模型‘参数膨胀’提供新路径,还在多领域应用表现出色。

机器之心
开源动态8

模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
新闻资讯8

对话淘宝姜宇宁:如果你只推低价商品,是不需要用大语言模型

淘宝姜宇宁团队上线RecGPT百亿参数推荐大模型,对“猜你喜欢”功能技术升级。大模型赋予传统推荐系统新能力,如让其“白盒化”、理解长上下文等。姜宇宁认为AI要创造商业价值,落到业务场景形成正向循环

AI科技评论
开源动态8

别问树模型了!死磕结构化数据,清华团队把大模型表格理解推到极限

AI 时代处理结构化数据成痛点,LLM 大模型难以满足生产要求。清华大学与稳准智能联合发布的 LimiX 系列模型,做到真正通用,在跑分和实际落地表现出色,其轻量级版本 LimiX - 2M 适合边缘设备和科研场景。

机器之心
开源动态8

预训练就学会思考!字节、北大等用14亿参数,撬动百亿模型推理能力

字节、北大等联合发布Ouro模型,用14亿参数实现百亿级模型推理能力。它在预训练阶段学会循环思考,通过三大创新构建推理能力,在基准测试中表现优异,实现参数效率提升,是潜在推理范式的胜利。

AIGC开放社区
新闻资讯7

GPT-6 真要来了!OpenAI全新推理架构“循环深度”首次曝光:可榨出14倍参数潜能

OpenAI将推旗舰模型GPT - 6(内部代号Astra),采用“循环深度”新技术,能榨出14倍参数潜能,降低成本,但会使AI推理过程不可读,加重安全担忧。OpenAI已因该模型“能力过强”踩刹车。

InfoQ
开源动态8

给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化

伴随多模态大模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸多挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。

量子位
算法论文8

模型也需要自我反思,上海AI Lab合成“错题本”让大模型数学成绩提升13.3%

上海AI Lab提出LEMMA方法,构建“错误 - 反思 - 修正”数据,让大模型从错误中学习。通过教师模型定向制造“学生会犯的错”构造数据,实验显示在Llama3 - 8B上数学解题准确率提升13.3%。

量子位
开源动态8

模型即智能体,Kimi K2 Thinking多项评估超越顶尖闭源模型,300轮工具调用不疲倦

月之暗面发布Kimi K2 Thinking,它是Kimi迄今最强开源思考模型,基于模型即智能体理念训练,可自主连续工具调用与多轮思考,多项评估超顶尖闭源模型,还实现原生INT4量化,提升生成速度。

AIGC开放社区
开源动态8

国产类脑大模型适配国产沐曦GPU!长序列推理提速超百倍,仅用2%数据匹敌主流模型

中国科学院自动化所李国齐、徐波团队发布类脑脉冲大模型SpikingBrain (瞬悉)-1.0,借鉴大脑信息处理机制,适配国产沐曦GPU,长序列推理提速超百倍,仅用2%数据匹敌主流模型,探索构建国产自主可控类脑大模型生态。

量子位