「多模态搜索智能体」共找到 4457 篇相关文章
走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则
文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。
机器人长出800个心眼?阿里达摩院开源具身新大脑,硅谷又坐不住了
2026年具身智能竞争激烈,阿里达摩院开源RynnBrain“具身大脑”。它采用分层架构,在16项评测中超越前沿模型。还介绍了核心技术、训练策略等,且全系列模型、评测基准和代码均开源。
Clawdbot国产芯片适配完成!清华特奖出手,开源框架直接一键部署
Clawdbot(现名OpenClaw)超火,不到一周GitHub达12万Star。但使用成本高,新开源的国产框架玄武CLI可让其在本地运行,适配国产芯片,还能降低成本,避免信息泄露。
国内首个!360发布“纳米漫剧流水线”,AI漫剧生成进入工业化时代
1月29日,360宣布国内首个工业级AI漫剧智能体生产平台“纳米漫剧流水线”公测。它整合多环节,素材生成成功率超90%,单集制作缩至1小时内,已和多家公司合作,推动构建行业标准。
大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026
阿里巴巴未来生活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。
CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态
CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。
通用级PixVerse P1的技术突破,揣着进入平行世界的密码
PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。
大模型长脑子了?研究发现LLM中层会自发模拟人脑进化
帝国理工学院等机构研究人员发表论文,指出大型语言模型(LLM)学习中会自发演化出类似生物大脑的协同核心结构。研究对多个模型剖析,揭示其内部处理规律,为大模型可解释性开辟新路径。
GEO破圈,豆包爆火,为什么我劝你别轻易丢掉SEO?
A股GEO概念股大涨、罗永浩与豆包对话爆火,让老板和SEO朋友焦虑是否转型GEO、SEO是否凉了。作者认为GEO是未来要重视,但不能丢SEO基本功,还给出构建“SEO+GEO”双引擎的建议。
从大厂设计师到超级一人公司:6000字回顾我和AI的2025
作者回顾2025年,身份从大厂设计师变为自由职业者,用AI加持做超级一人公司。自媒体上各平台粉丝量增长,开始做视频;社群活动帮创业者和会员;创作涵盖Vibe Coding、Agent、图像视频等;还介绍合作产品,展望2026年AI趋势。