智能影像技术红利」共找到 5601 篇相关文章

开源动态8

用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源

华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位
产品应用7

既要安全⼜要弹性,理想汽车如何解开企业 OpenClaw 落地死结|甲子光年

2025年以来,大模型应用飞速发展,以OpenClaw为代表的开源框架是变革催化剂,但其在企业级生产环境有缺陷。理想汽车以阿里云ACS Agent Sandbox及ACK为核心,为Agent构建专属‘沙箱’,解决落地难题。

甲子光年
新闻资讯7

20岁了!劈柴哥发帖庆生:谷歌翻译换了4代AI,第一次有了「呼吸感」

4月28日,Google Translate满20岁,Pichai发帖纪念,回顾其技术发展,从统计模型到神经网络,再到Gemini原生语音模型,Translate不断进化,能保留语调和节奏,虽被大模型抢风头,但仍在持续进步。

新智元
新闻资讯7

让Agent真正“行动”起来,Agent Skill开发者大赛火热报名中!

人工智能下半场关键词是“行动”,Agent Skill成关键桥梁。Agent Skill开发者大赛今日启动,由AIGC开放社区与算泥社区联合主办,聚焦真实任务执行,设双赛道,官方提供支持,有丰厚奖励。

AIGC开放社区
算法论文8

打破视频推理「先看后想」惯性,实现真正的「边看边想」丨CVPR'26

现有大型视觉语言模型(VLM)在实时场景表现不佳,宁波东方理工大学沈晓宇团队提出TaYS,让VLM从“帧文交错”切换到“并行”,实现“边看边想”,在准确性和延迟上表现出色,推动VLM走向更真实应用。

量子位
开源动态8

本周 5 个超酷 GitHub 开源项目,实用到飞起!

本文介绍本周5个超酷GitHub开源项目。有显示苹果设备电池状态的AirBattery,开源卫星可视化平台keeptrack.space,本地图片压缩工具Pic - Smaller,跨平台端口助手Port - Killer,轻量级AI证件照工具HivisionIDPhotos。

开源先锋
新闻资讯7

2026年AAAI Fellow名单出炉!清华校友田奇等4位华人学者入选

2026年AAAI Fellow名单出炉,12位学者当选,含4位华人,分别是南洋理工大学的Bo An、香港中文大学的Irwin King、南加州大学的Yan Liu和光明实验室的Qi Tian。AAAI将在会议期间的颁奖典礼上表彰他们。

新智元
算法论文8

耶鲁大学新研究揭示 AGI 时代的残酷现实

耶鲁大学新论文揭示AGI时代残酷现实,人类将失去经济价值。AGI会自动化“瓶颈”工作,人类从事“辅助性”工作,工资取决于计算成本,劳动收入占比趋近零,应思考财富重新分配。

宝玉AI
新闻资讯8

逛完世界机器人大会,我们发现了四大趋势|甲子光年

2025世界机器人大会8月8日在北京开幕,有200余家企业参展。甲子光年总结四大趋势,如激光雷达厂商入局、人形机器人进厂、VLA模型异军突起、仿生机器人走入现实,预示机器人产业走向实战。

甲子光年
开源动态7

Trae-Agent 刚刚开源,Windows-MCP 操作你的电脑,Chrome MCP 让AI自动化完成浏览器任务。

Trae - Agent 开源,可完成软件工程任务。Windows - MCP 能让 AI 操作 Windows 系统,Chrome MCP Server 使 Chrome 成 AI 助理。还介绍了 Gemini Cli、Claude 等工具及特点。

AI进修生