「智能体任务」共找到 4976 篇相关文章
DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini
DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。
再见了, OpenAI!三年老用户忍痛卸载ChatGPT
从ChatGPT惊艳问世到如今广告缠身,OpenAI乌托邦梦碎!谷歌和Anthropic强势反扑,达沃斯论坛上互怼升级。OpenAI在AI大战中似已落后,还面临马斯克诉讼、巨额算力承诺等问题。不过投资人认为4家AI巨头终将平安落地。
把大厂 10 年的职场经验,做成了一个「Coze Skill」—— 扣子 2.0 深度实测
作者实测扣子 2.0,介绍其「技能商店」功能,可将专家方法论封装成技能供调用。通过简历诊断、画架构图、生成 GEO 稿件三个场景展示提效作用,还提及「长期计划」功能,称扣子定位职场 AI,降低使用门槛。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
那个固执的法国老头走了,带走了硅谷最后的理想主义
2026年1月,65岁的Yann LeCun离职Meta创业后炮轰老东家。他曾被扎克伯格“三顾茅庐”加入Facebook,创建FAIR。他推动了PyTorch发展,坚持智能应基于世界模型,与主流LLM路线分歧,最终因理念不合离开。
Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级
新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。
全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案
随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。
谷歌突砍Gemini免费版炸锅,数据养模遭背刺?GPT-5.2突袭Gemini 3,Demis Hassabis:谷歌须占最强位
近日谷歌收紧Gemini API免费层级限制,引发开发者不满。同时,OpenAI计划提前发布GPT - 5.2竞争。谷歌DeepMind的Hassabis表示要与OpenAI竞争到底,对Gemini 3满意,还介绍了谷歌未来三个主打方向。
Human In the Loop竟然可以是个MCP?
文章基于阿里实践,阐述如何在大模型研发平台OpenLM及其他Agent平台,针对“Human In The Loop”场景做产品设计与研发。介绍用MCP实现人机回路的方案,还探讨人类回答及提示词倾向性等问题。
四足机器人首次同时「思考+走路」,北大提出链式推理MobileVLA-R1
在「大模型+机器人」浪潮中,让机器人既听懂话又走得对、稳很难。北大MobileVLA - R1将链式思考引入四足机器人,在仿真和真实实验中对标强基线实现提升,构建了更具工程可用性的范式。