「人工视觉」共找到 837 篇相关文章
Qwen最新3.7 Max预览版空降!两代超大杯并行迭代,林俊旸走了但还在加速
Arena公布Qwen3.7-Max-Preview和Qwen3.7-Plus-Preview成绩,文本和视觉领域均为国产第一。Qwen3及以后迭代提速,大版本间隔缩至2-3个月,反映阿里Qwen团队进入快速实验、高频交付阶段。
实测Claude Opus 4.7,好好的模型也开始不说人话了。
作者实测Claude Opus 4.7,它已全渠道上线,价格不变。该模型有多处更新,如隐形涨价、视觉能力提升、审美进步,但也出现不说人话的问题,还新增了effort档位、/ultrareview命令和Cyber Verification Program。
刚刚,杨植麟亲自开源Kimi K2.5!国产大模型打架的一天
今天国产大模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。
具身机器人征服1万伏高压线!-10℃严寒、13米高空全天候作业零事故
亿嘉和新一代配网带电具身智能机器人能在1万伏高压线上独立完成复杂精细操作,已在多省份部署,完成万余次任务。它“有脑子”,效率接近人工90%且零事故,未来还将迭代升级。
Google Design.md:一键复刻60+大厂设计规范 | 设计界的事,能叫偷吗?
今天分享Google Stitch团队提出的DESIGN.md标准,单文件搞定网页设计。62个真实网站视觉语言对应的DESIGN.md可在https://getdesign.md/获取,它也是开源项目。放入项目根目录后,AI编程助手可读取生成风格一致的UI组件。
真正的一句话修图:Gemini 用香蕉模型给出了图像生成的分水岭
Google新模型Gemini 2.5 Flash Image可在AI Studio体验。它有多图融合、角色一致性等能力,能实现自然语言编辑图像,速度快、价格低、API可用,虽有中文体验等问题,但有望让AI视觉工具进入工程化时代。
豆包悄悄上线的这个新功能,也能用眼睛推理全世界了。
作者分享豆包新上线的视觉推理功能,在PC和手机场景使用体验良好。通过ChinaJoy图片、德爷相关图片、表情包等实例展示其推理能力,虽有软肋但很实用,还免费,体现出与其他工具的差距。
AI秒懂短视频,快手大模型Keye-VL理解力爆表!技术细节全开源
快手全新多模态大语言模型Kwai Keye-VL上线且开源,能深度融合多模态信息,在视频理解、复杂视觉感知和逻辑推理上表现优异。介绍了其技术架构、预训练和后训练策略及训练架构优化等内容。
沉迷贪吃蛇,7B小模型竟变身「数学天才」!几何推理碾压GPT-4o
NVIDIA等团队提出视觉游戏学习ViGaL范式,让7B多模态模型玩贪吃蛇等游戏,使其在数学、几何等任务击败GPT - 4o。游戏培养通用认知与推理能力,不同游戏提升不同推理能力,多游戏训练效果更佳。
靠创始人亲自假扮AI起家,如今估值10亿美元!印度CEO公开反内卷:从不在10点前起床,也不开例会
AI笔记创业公司Fireflies估值达10亿美元,其创始人曾人工假扮AI参会。CEO Krish Ramineni反内卷,让员工全远程自由工作。此“创业血泪史”公开后引争议,有人批有伦理风险,也有人认为是早期创业常态。