视觉趋势」共找到 1059 篇相关文章

开源动态8

字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star

字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。

量子位
开源动态8

深度研究白菜化?谷歌将Gemini级AI研究能力开源

谷歌推出'gemini-fullstack-langgraph-quickstart'开源项目,用Gemini 2.5与LangGraph结合,可构建本地运行的深度研究智能代理系统。介绍其技术架构、工作流程、开发配置、部署扩展,还展示了现代AI应用开发趋势

AI寒武纪
推荐文章7

00后女生躲进房间造梦:我想让1000个焦虑的人,变成一只轻盈的蝴蝶

00后女孩陈栩乐是深耕VR交互领域的创作者。她以蝴蝶为具身载体,打造VR疗愈作品《Crossing the Senses》,用点云视觉呈现自然能量交换。创作中AI助力破技术难题,她追求轻交互疗愈。

MANA新媒体艺术站
产品应用8

今天,被GLM-5的Agentic Coding能力惊艳到了

上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。

PaperAgent
新闻资讯8

Artificial Analysis 发布 2025 年 AI 现状 Q3 季报

Artificial Analysis发布2025年Q3 AI现状报告,揭示五大关键趋势,如推理模型占智能榜单前十、智能体能力突破、开源模型发布创新高、图像视频技术主流化、原生语音模型达生产级,还将举办简报会。

AGI Hunt
产品应用7

我复刻了 Claude 刚发布的生成式 UI 交互!

Anthropic在Claude上线基于生成式UI的新交互,作者复刻该功能到Code Pilot。介绍其多种玩法,如数据分析、制作小工具等,还阐述实现过程与体验打磨细节,保证生成式UI视觉稳定。

歸藏的AI工具箱
产品应用7

Alibaba力作:Ovis-U1 融合理解、生成与编辑,解锁无限可能

OpenAI 2025 年推出的 GPT - 4o 结合图像与语言能力,但引发视觉解码器设计及统一模型训练问题。Alibaba 力作 Ovis - U1 单一模型能完成理解、生成与编辑任务,介绍了其架构、训练过程和应用。

CourseAI
算法论文8

治好多模态近视和走神!上海大学去偏干预显著提升模型性能

多模态大模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海大学与南开大学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。

AIGC开放社区
8

How To Play AI Beta:拾象 2026 AGI 投资思考开源

这是拾象团队的 AI 投资思考报告,复盘当下竞争时局,拆解 2026 年核心技术与产品趋势。分析了头部模型格局、技术路线、算力阵营等,探讨投资策略,还提及多模态、机器人、Agent 等领域发展。

海外独角兽
新闻资讯7

OpenAI估值暴涨至5000亿美元,并出售103亿美元股票

今天凌晨3点CNBC消息,OpenAI以5000亿美元估值出售103亿美元二级股票,规模较原计划提升超40亿美元。数月内其估值大幅提升,投资方阵容强大,此举措延续行业趋势

AIGC开放社区