「从零训练」共找到 4909 篇相关文章
美团开源全模态,比肩顶级闭源模型,开源新SOTA
美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在多基准测试表现出色。
代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈
ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。
告别“对讲机”时代:面壁智能给 AI 装上了“神经末梢”
2026 年初,OpenClaw 等开源项目让 Agent 概念爆火,但存在延迟、隐私等问题。面壁智能发布 9B 小模型 MiniCPM - o 4.5 和硬件开发板松果派,解决 AI 本地运行痛点,推动其从云端到端侧进化。
突破具身智能任务规划边界,刷新具身大脑多榜单SOTA,中兴EmbodiedBrain模型让具身大脑学会「复杂规划」
当前主流大语言模型在具身任务场景面临瓶颈,中兴星云大脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。
模型即智能体,Kimi K2 Thinking多项评估超越顶尖闭源模型,300轮工具调用不疲倦
月之暗面发布Kimi K2 Thinking,它是Kimi迄今最强开源思考模型,基于模型即智能体理念训练,可自主连续工具调用与多轮思考,多项评估超顶尖闭源模型,还实现原生INT4量化,提升生成速度。
北大字节开源首个时空推理视频模型!思考过程全透明,性能超越GPT-4o
北大和字节联合团队推出开源模型Open-o3 Video,将显式时空证据嵌入视频推理全过程,采用non-agent架构,性能超越GPT - 4o等闭源模型。该模型构建了STGR语料体系,采用双阶段训练,实验表现优秀。
StereoAdapter:北大首提自监督,适配水下双目深度估计
水下机器人深度感知难题待解,北大等机构提出StereoAdapter框架。它结合单双目视觉,以自监督学习适配视觉基础模型到水下域,设计双阶段结构、自监督训练策略等,实验效果好,未来还将多方面改进。
字节跳动Seed推出「机器人大脑」Robix:让机器人学会思考、规划与灵活互动
近日,字节跳动Seed团队发布「机器人大脑」Robix,它将推理、任务规划与人机交互整合到单个端到端多模态模型。通过层次化架构分工,它能灵活互动,经三阶段训练,在多方面表现出色,为具身智能体发展奠基。
AI来了!记者、UP主、写手,谁能逃过这场「灭绝浪潮」?
AI深度渗透新闻采编等流程,从Perplexity收购Chrome到Particle打造新闻摘要,正重构信息入口与用户体验。记者岗位面临挑战,57%的人认为会被取代,AI也冲击内容创作,重塑互联网内容。
多模态模型学会“按需搜索”,少搜30%还更准!字节&NTU新研究优化多模态模型搜索策略
字节与NTU优化多模态模型搜索策略,通过搭建工具、构建数据集及设奖励机制,用强化学习训练模型,使其按需搜索。实验显示,MMSearch - R1系统少搜30%还更准,为多模态大模型发展提供洞见。