「视觉流」共找到 796 篇相关文章
AI算力饥渴和高能耗困局谁来解?两位95后创始人用相变材料光计算构建新范式
AI算力供需失衡致数据中心能耗激增,传统电芯片性能提升放缓。光本位科技由两位95后创立,2024年6月流片全球首颗128×128矩阵规模光计算芯片,推动光计算商业化,正布局产品商用。
实测Claude Opus 4.7,好好的模型也开始不说人话了。
作者实测Claude Opus 4.7,它已全渠道上线,价格不变。该模型有多处更新,如隐形涨价、视觉能力提升、审美进步,但也出现不说人话的问题,还新增了effort档位、/ultrareview命令和Cyber Verification Program。
刚刚,杨植麟亲自开源Kimi K2.5!国产大模型打架的一天
今天国产大模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。
Google Design.md:一键复刻60+大厂设计规范 | 设计界的事,能叫偷吗?
今天分享Google Stitch团队提出的DESIGN.md标准,单文件搞定网页设计。62个真实网站视觉语言对应的DESIGN.md可在https://getdesign.md/获取,它也是开源项目。放入项目根目录后,AI编程助手可读取生成风格一致的UI组件。
真正的一句话修图:Gemini 用香蕉模型给出了图像生成的分水岭
Google新模型Gemini 2.5 Flash Image可在AI Studio体验。它有多图融合、角色一致性等能力,能实现自然语言编辑图像,速度快、价格低、API可用,虽有中文体验等问题,但有望让AI视觉工具进入工程化时代。
单卡4090也能高质量视频编辑!西湖AGI Lab无训练框架FlowDirector来了
视频编辑门槛高、现有方法开销大且效果不佳。西湖大学AGI Lab团队提出无需训练的FlowDirector框架,可将基于流的视频生成模型改造成编辑工具,质量高、功能广、开销低,解决了时序、结构和编辑幅度问题。
马斯克变身「算力包租公」!砸数万GPU疯狂喂养Cursor,联手反杀OpenAI
马斯克将xAI变成「算力包租公」,租数万GPU给Cursor训练模型,还挖来Cursor高管。同时,特斯拉AI5芯片流片成功,AI6也有规划,Dojo 3项目重启,他正用「硬件思维」重塑AI竞争格局。
告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍
视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅度,为VLA模型部署提供新方案。
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
豆包悄悄上线的这个新功能,也能用眼睛推理全世界了。
作者分享豆包新上线的视觉推理功能,在PC和手机场景使用体验良好。通过ChinaJoy图片、德爷相关图片、表情包等实例展示其推理能力,虽有软肋但很实用,还免费,体现出与其他工具的差距。