「图像类型」共找到 587 篇相关文章
是「福尔摩斯」,也是「列文虎克」,智谱把OpenAI藏着掖着的视觉推理能力开源了
智谱开源视觉推理模型 GLM-4.5V,还同步开源桌面助手应用。此模型视觉推理能力强,在图像识别、视频理解、前端复刻、图表处理等多方面表现出色,技术创新使其达开源 SOTA 水平,推动行业注重实用价值。
Marble登场!告别不稳定与变形,持久探索3D世界
李飞飞团队World Labs推出Marble并开放有限测试预览,基于图像或文本提示可生成3D世界,具有持久、稳定、风格多样等特点。用户能导出使用,在浏览器自由导航,虽有局限但潜力大。
Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率
Mistral 发布 OCR 3,在多种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。
天下苦VAE久矣:阿里高德提出像素空间生成模型训练范式, 彻底告别VAE依赖
当前主流图像生成技术训练范式依赖VAE,带来训练复杂、微调成本高的问题。阿里高德提出EPG,结合自监督预训练与端到端微调,去除对VAE依赖,在训练效率和生成效果上有突破。
从零开始玩转循环 (Getting started with loops)【译】
Claude Code团队将“循环”定义为AI智能体不断重复执行工作周期,直至满足预设停止条件。文章介绍了回合制、目标导向、基于时间和主动式四种循环类型、适用场景及控制token消耗方法,还给出保证代码质量的原则。
清华给电子显微镜加上Agent,DeepSeek V3全程调度,数天流程缩短至几分钟
清华大学牵头,联合多机构推出电镜领域AI Agent AutoMat,它能把原子级STEM图像转成标准CIF结构并给出关键物性,将人工流程缩短至几分钟。它还构建数据集验证,性能超现有工具,不过也有瓶颈待解决。
开源仅一周,鹅厂文生图大模型强势登顶,击败谷歌Nano-Banana
腾讯混元团队开源的原生多模态生图模型混元图像 3.0,开源仅一周就在国际权威评测榜单 LMArena 上超越谷歌 Nano - Banana 等,位列文生图综合和开源榜单第一。实测表现出色,技术上也有诸多创新。
Crossplane 2.0 发布:在云基础设施之上全面支持应用管理
Crossplane 开源项目发布 2.0 版本,将管理范围从云基础设施拓展到应用与基础设施协同编排。解决了基础设施与应用需分开管理的问题,新增应用支持,改进组合资源,采用命名空间优先设计,还引入新 Operation 类型。
Cursor只排第6!136国用户实测25款AI编码工具,第一名73%胜率,还是个新面孔
Design Arena评测平台用对抗式评测方法,让用户对AI模型生成的设计作品投票,评估其设计美学表现。文章总结了上榜的编码工具,如new.website胜率约73%排第一,还对比了不同类型模型的排名情况。
Devin CEO:别搞多智能体!Anthropic:我们性能提升90%!
最近,开发Devin的Cognition CEO发文称不要构建多智能体系统,而Anthropic分享构建多智能体研究系统,性能提升90%。Cognition认为多智能体协同难,坚持单线程线性Agent;Anthropic用工程设计绕开瓶颈。二者因任务类型不同观点有别。