「视觉输入」共找到 866 篇相关文章
BLIP3-o统一图像生成与理解,多模态融合趋势显现
BLIP3 - o致力于统一图像理解和生成、提升生成质量和效率。它融合自回归与扩散模型,采用CLIP + Flow Matching架构等技术亮点。经训练,在图像理解和生成任务表现出色,指令微调效果显著。
文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”
港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。
Claude Code没有“魔法”
资深工程师 Daisy Hollman 在演讲介绍了 Claude Code 插件设计与上下文工程原语,以及 Anthropic 内部多 Agent 工作流。指出定制模型可放大能力,上下文窗口是关键,还探讨多种插件抽象与工作流扩展方式。
藏在机器人指尖的AI底座:一家触觉公司的野心|甲子光年
本文指出机器人产业正补触觉这一课,2026年以来触觉成具身智能热门方向。但给机器人装传感器不代表其有触觉。以他山科技为例,剖析其全栈布局,探讨让机器人从物理世界获经验的路径及产业发展机会。
The Batch: 964 | Claude 亮相另一款 Opus
Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。
四大AI手搓蒙娜丽莎!8次临摹,最像那版全被自己改没了
AI工具平台TryAI搭建「绘画竞技场」,让GPT - 5.6 Sol等四个视觉模型临摹蒙娜丽莎等,记录实验过程。结果显示,模型最终作品不如中途最佳版,且成本差异大,工具使用方式不同。
谷歌放的这波免费AI额度,大到很多人以为是假的
谷歌在Google AI Studio上调整Gemini API免费层规则,额度达每分钟100万token,无额外申请门槛。覆盖Gemini 2.5全系列模型,支持多模态输入。开发者反应两极,有人看好,也有人质疑。
AI 会笑吗?BIGAI & 上交大团队:多模态大模型是否真的能 get 到视频笑点|ACL 2026
上海交通大学等团队构建v-HUB评测基准,分析多模态大模型视频幽默理解能力。评测7个前沿模型发现,模型依赖文字、主动发现笑点能力弱,声音作用有限,还需考虑隐形线索。
Cloudflare 构建了面向 LLM 的高性能基础设施
Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。
用Claude Code剪视频,自动去口癖、加字幕、调色,完全免费开源
browser - use团队开源Claude Code技能video - use,可自动去口癖、加字幕、调色等。它通过转录文本和按需视觉合成图让LLM理解视频,有完整流水线和设计原则,还给出使用方法。