「视觉错觉图」共找到 899 篇相关文章
杨植麟预告,Kimi K3要来了
月之暗面团队海外AMA透露Kimi K3相关信息。K3或采用KDA架构,有低成本优势;通过开源解决信任问题;将推出不同规格模型;产品打磨注重写作、视觉能力及NSFW内容探索。Kimi性价比模式或改写行业规则。
美团开源全模态,比肩顶级闭源模型,开源新SOTA
美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在多基准测试表现出色。
即梦图片4.0来了,我整理了10个好用到爆的进阶玩法。
字节即梦图片4.0背后是seedream4.0模型,与NanoBanana性能相当,但支持直出4K图、自由控比例、文生图审美和可控性强,中文字生成领先。文章整理了它在虚拟模特、换装等10个方面的玩法。
ACL 2026 | Spatial-Agent:地图Agent全新概念转换范式
论文 'Spatial-Agent' 提出地理空间问答应建模为 'concept transformation',引入 GeoFlow Graph 中间表示。它从自然语言问题构建图结构,再映射到工具调用。实验显示其对地图任务有帮助,还指出构建地图类 agent 需稳定数据源等。
谷歌做了个论文专用版nano banana!顶会级Figure直出
科研人画论文插图耗时久、要求高,现有大模型搞不定。北大与Google Cloud AI Research团队推出PaperBanana,能按论文方法画顶会级Figure,不仅能从零生成,还能润色丑图,通过多智能体协作实现科研表达自动规范化。
劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束
谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。
8个月营收提高4倍,n8n如何成为AI Agent最受欢迎的搭建平台?
n8n由前《加勒比海盗》视觉设计师创立,从工作流自动化工具升级为AI应用编排层。8个月营收提4倍,正进行超1亿美元融资。它能与AI无缝集成,有活跃社区,在多场景应用广泛,不过用户多为技术人员。
字节最强多模态模型登陆火山引擎!Seed1.5-VL靠20B激活参数狂揽38项SOTA
5月13日,火山引擎在上海发布5款模型和产品,其中豆包1.5・视觉深度思考模型(Seed1.5-VL)最吸睛。它激活参数20B,性能与Gemini2.5 Pro相当,38个评测基准达SOTA,推理成本低,已开放API。
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来
近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。