「自动研究Skill」共找到 2722 篇相关文章
2026 开年 AI 巨作!超强搜索智能体模型 MiroThinker 1.5 开源,慢思考做到了极致!
2026年开局,MiroMind团队开源超强搜索智能体模型MiroThinker 1.5。它不是“秒回型AI”,会深入研究后输出有引用、数据和逻辑的研报,以“慢思考”机制在深度任务上表现出色。
深度解析世界模型:新范式的路线之争,实时交互与物理仿真
文章认为2026年多模态技术将有大发展,世界模型轮廓渐清。文中对比语言、视频生成模型,指出世界模型优势,分析实时视频与3D结构化两条路线,介绍不同公司产品并以四象限框架分类。
清华紧逼谷歌,AI顶会NeurIPS论文数第二!中国占半壁江山
NeurIPS 2025呈现前所未有的撕裂感,清华大学以微弱差距逼近谷歌。中国AI完成从数量堆叠到底层架构创新的「质变」,阿里千问团队获最佳论文奖,中国学者因签证问题有了墨西哥城卫星会场。
沉默的进化:LatentMAS 如何通过“潜意识通信”重塑多智能体协作?
这是对多智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。
Meta开源史上最强语音“基座模型”:一口气支持1600+种语言
Meta AI FAIR团队发布Omnilingual ASR模型套件,能为超1600种语言提供自动语音识别能力。它引入新架构提升性能,改变引入新语言范式,还发布相关数据集和模型,与全球伙伴合作。
自适应Agent基础模型:从“会推理/会用工具”到“懂得取舍的执行者”
当前大型语言模型在智能体/工具调用场景有推理型和工具型两类,存在效率与功能、深度的矛盾。A²FM框架提出多模式自适应路由,实现模式自适应切换,在多基准测试中效果与效率双升。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM多任务处理潜力,为自动驾驶等领域带来前景。
清华联手英伟达打造扩散模型新蒸馏范式!视频生成提速50倍,4步出片不穿模
清华大学朱军教授团队与NVIDIA Deep Imagination研究组联合提出分数正则化连续时间一致性模型(rCM),将连续时间一致性蒸馏扩展至大模型,解决现有方法瓶颈,提升推理速度兼顾质量与多样性。
刚刚,Anthropic 发布 Claude for Life Sciences,目标生物科研全流程
Anthropic推出Claude for Life Sciences,全方位布局生命科学领域。它配备Skills功能,生物学测试表现提升,能解读图像、分析数据。还深度整合科研生态,应用场景广,获众多药企、学术机构青睐,还有AI for Science计划。
教多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题
上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。