视觉功能」共找到 2167 篇相关文章

产品应用7

电脑操作、技能、连接器、工作伙伴:豆包的牌来了

最近字节有两个豆包相关新闻,一是在训练超大模型,二是反对模型蒸馏。豆包上线大批 Agent 相关工作任务能力,覆盖办公场景,如电脑操作、技能商店等,过程流畅且可观察,还更新移动端,实现远程控制。

MacTalk
推荐文章7

藏在机器人指尖的AI底座:一家触觉公司的野心|甲子光年

本文指出机器人产业正补触觉这一课,2026年以来触觉成具身智能热门方向。但给机器人装传感器不代表其有触觉。以他山科技为例,剖析其全栈布局,探讨让机器人从物理世界获经验的路径及产业发展机会。

甲子光年
产品应用7

The Batch: 964 | Claude 亮相另一款 Opus

Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。

DeeplearningAI
开源动态8

一个窗口搞定 SSH、SFTP、终端和 AI,爽啊!

早期运维、开发需多个工具,窗口多效率低,后来的工具又有收费、收集数据等问题。Netcatty是新的开源SSH工作区,整合多种功能,免费无数据收集,更新勤快,有诸多实用特性。

开源先锋
新闻资讯7

四大AI手搓蒙娜丽莎!8次临摹,最像那版全被自己改没了

AI工具平台TryAI搭建「绘画竞技场」,让GPT - 5.6 Sol等四个视觉模型临摹蒙娜丽莎等,记录实验过程。结果显示,模型最终作品不如中途最佳版,且成本差异大,工具使用方式不同。

新智元
新闻资讯7

AI浏览器这百亿大蛋糕,谁也没吃到?

2023年大模型火时,AI浏览器被视为百亿创业项目,曾诞生创业热潮。但三年来,它未能让用户换掉传统浏览器,经历从加AI助手到与Agent结合阶段,面临权限、信任等问题,未获主流认可。

鲸选AI
产品应用8

让 AI 自己做增长:基于OPC和Harness思想的自主增长系统探索

文章围绕让AI自主做增长,基于OPC和Harness思想构建自主增长系统展开。介绍了系统背景、做法、多Agent架构落地方案,还提及踩坑问题、解决方案及对未来的思考,如完善数据集、探索OPC + AI Agent模式。

阿里云开发者
算法论文8

AI 会笑吗?BIGAI & 上交大团队:多模态大模型是否真的能 get 到视频笑点|ACL 2026

上海交通大学等团队构建v-HUB评测基准,分析多模态大模型视频幽默理解能力。评测7个前沿模型发现,模型依赖文字、主动发现笑点能力弱,声音作用有限,还需考虑隐形线索。

AI科技评论
产品应用8

TRAE SOLO 移动端发布!超级 Agent 终于走出了桌面

TRAE SOLO 移动端正式上线,同时 Windows 版本也同步发布,实现手机、PC、Web 三端全量开放且无需邀请码。它能完成多种任务,三端任务信息实时全量同步,设备配对简单,在生产力场景实测效果出色。

特工宇宙
开源动态7

Vercel 开源 Open Agents,支持后台运行 AI 编码工作流

Vercel 开源 Open Agents,支持创建和运行后台编码智能体,提供全栈解决方案。它采用三层架构,核心是智能体与沙箱解耦,支持多步执行等功能,定位为参考实现,引发不同反响。

InfoQ