「视觉反思」共找到 749 篇相关文章
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。
地平线首曝BPU「黎曼」架构,用数学流形重构AI计算
2025 年 12 月 8 日深圳举办的地平线技术生态大会上,地平线首曝 BPU「黎曼」架构,用数学流形重构 AI 计算。还发布第四代编译器,推出 HSD Together 模式,开源具身智能模型,欲构建物理 AI 世界底层生态。
Nano Banana 2突然现身!能画公式解数学题,监控画面都能伪造
Nano Banana 2代以预览版现身第三方网站,后被移除。其能力远超1代,能处理复杂提示,可生成复杂UI、解数学题甚至伪造监控画面。谷歌正将Nano Banana整合进核心产品生态。
终于有AI视频模型,解决了体操难题。
前天深夜MiniMax发布Hailuo 02视频模型,虽未正式上线但放了预告片。该模型能生成杂技动作,解决了体操难题,在复杂动作肢体表现上吊打其他模型,还支持原生1080P,价格便宜。
图文跨模态“近视”问题破局:360开源新模型 FG-CLIP,实现细粒度图文对齐突破|ICML2025
360人工智能研究院发布 FG - CLIP 模型,攻克图文细粒度对齐难题,成果被 ICML 2025 接收并开源。它采用双阶段训练等策略,在多任务评测中超越对比模型,推动跨模态研究产业化落地。
一行 Python,生成绝美城市地图海报!
开源君发现宝藏项目`prettymaps`,这是巴西开发者Marcelo Prates的开源作品,能从OpenStreetMap拉取数据画定制地图。它功能丰富,安装简单,可让普通人轻松进行地图视觉创作。
Fable 5榜单第一靠作弊?代码泄露,模型真实身份曝光
黑客泄露Claude Fable 5长达12万字符的系统提示词,揭示它并非大模型,而是伪装成LLM的完整Agent系统。这颠覆了对AI模型的认知,也让Anthropic陷入舆论漩涡,还暴露了其计费黑幕。
干掉 .md?兜里 Token 不够,没法和 Karpathy 共情
近日,围绕‘Markdown 是否已过时’讨论升温。Theo Browne 视频阐述‘HTML 优于 Markdown’五大理由并分享实操技巧,虽指出 HTML 有费 Token、版本控制差问题,但仍倾向用 HTML,不过也有开发者质疑。
Claude Opus 4.7发布:更强能力,自我纠错,越来越不需要人类干预了
Anthropic发布Claude Opus 4.7版本,搭配Routines功能可自动化工作,人类干预减少。该版本能力大幅增强,还引入护栏机制保障安全,推出新运算级别和任务预算功能。
解决VLA模型落地难,普通硬件也能跑!全透明全开源的高效VLA模型把推理成本砍掉76%
2026年4月,中山大学与MBZUAI联合推出A₁模型,它是完全开源透明、自适应高效的截断式视觉 - 语言 - 动作模型,能削减推理成本、实现低成本落地,在仿真与真机上表现优异。