「视觉理解模型」共找到 8270 篇相关文章
阿里通义新年礼物:开源最强Qwen-Image-2512版本告别AI塑料感与文字乱码
通义万相新年前发布Qwen - Image - 2512版本。它是开源界最强文生图模型,在AI Arena盲测中表现出色。能消除AI塑料感,攻克文字渲染难题,在还原真实世界和重构视觉元素逻辑排版上有显著提升。
GPT-5.2 发布:做表格、写 PPT、敲代码 | 打工人的生产力利器
GPT - 5.2发布,在GDPval评测等众多基准测试中刷新行业水平。GPT - 5.2 Thinking适合真实场景与专业工作,在知识型任务、编码、长上下文处理、视觉理解、工具调用等方面表现出色,部分功能需付费使用。
Dexmal原力灵机开源Dexbotic,基于PyTorch的一站式VLA代码库
Dexmal原力灵机推出基于PyTorch的开源视觉-语言-动作模型(VLA)代码库Dexbotic,面向具身智能研究者。其架构含三大核心组件,有五大特征,还推出开源硬件,未来将持续投入生态建设。
半在线RL新范式UI-S1,使得GUI Agent既稳定又规划长远
现有AI训练方法在GUI自动化中各有弊端,本文提出半在线强化学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用化AI智能体的重要一步。
炮轰黄仁勋,决裂奥特曼!1700亿美元估值背后,硅谷最不好惹的AI狂人
本文介绍AI圈大佬Dario Amodei,因家庭变故投身AI。他带领Anthropic发展迅速,拟融资使估值达1700亿美元。不过公司亏损严重,且面临开源模型竞争。他坚信AI发展快,要加速开发并注重安全。
Qwen3.8-Max:编程与办公,全面跃升
今日正式发布Qwen3.8-Max,下周将开源其及Qwen3.8 - 27B模型权重。它参数达2.4万亿,在多方面全面提升。开发者可通过千问AI平台获API服务,性价比高。在编程、办公等场景表现出色,用户反馈良好。
黄仁勋人生第一推,把硅谷劈成了两半!
7月24日晚,黄仁勋在X首发帖,公布25家联署的‘开源为什么重要’公开信,引发关注。马斯克、奥特曼等表态支持,但OpenAI等闭源三巨头缺席。信中为‘蒸馏’正名,凸显‘扩散派’与‘稀缺派’矛盾,中国开源模型崭露头角。
太抓马了!马斯克OpenAI开庭,硅谷巨富互揭老底像极了村口吵架
马斯克与OpenAI的世纪庭审爆点不断。马斯克承认xAI用OpenAI模型训练Grok,且庭审中六次失态;OpenAI也有黑料,如Brockman日记暴露其私下盘算。目前风向对马斯克不利,后续还有奥特曼等证人登场。
给 Happy Horse-1.0 讲完戏,我无痛当上导演了
文章聚焦阿里新发布的视频模型Happy Horse-1.0,经测试它在多镜头一致性、人物表现力和视频编辑功能上表现出色,能产出电影质感画面,且价格有竞争力,但物理拟真短板明显,已具影视工业应用潜力。
第一章:AI 技术前沿全景
文章聚焦AI Agent技术前沿,阐述大语言模型三次能力跃迁,从涌现能力到对齐指令遵循,再到推理与行动。还提及Scaling Law变化,推理时计算扩展更划算,介绍代表性推理方案及多模态融合,指出Agent打破传统对话AI局限。