看图测试」共找到 2378 篇相关文章

开源动态8

5B参数+4060Ti,10秒出,全流程开源可复现!补齐统一多模态生成编辑的开源版,让高质量像生成真正变得更轻量、更普及

近日,多机构联合发布统一多模态生成编辑模型DeepGen 1.0,仅5B参数,集成五大能力,4060ti 16G上10秒出,多项指标超大4倍工业级模型。团队开源全流程代码与数据,可从零复现。

量子位
新闻资讯7

Claude强到不敢发的Mythos,被质疑用了字节Seed技术

Claude最强“神话”模型Mythos引发猜测,或用了字节Seed技术。社区热议其是否采用循环语言模型架构,关键线索来自Anthropic测试数据,在搜索测试中Mythos优势明显,还有其他线索指向循环架构。

量子位
开源动态8

超过GPT-image-1!大黑马Black Forest刚开源新模型,只用文本实现一键PS

今日凌晨,Black Forest开源文生模型FLUX.1-Kontext开发者版本,功能类似PS,用自然语言就能一键P测试显示它超GPT-image-1,成最强开源文生模型之一,还在架构、训练、工程层面做了优化。

AIGC开放社区
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI
新闻资讯7

谷歌新版Gemini马甲被扒! LMArena实测:唯一能懂表的AI, GPT-5乱答

谷歌Gemini 3.0疑似上线LMArena,其Pro和Flash马甲被扒。实测中,Gemini 3 Pro能精确表,GPT - 5等表现不佳;SVG测试有提升但也有不足;还能作曲。不过评测方式老套,希望有新花样。

新智元
开源动态7

实测最新开源的DeepSeek-OCR后,我有些不一样的法,有些话可能只有我敢说

实测最新开源的DeepSeek - OCR,它并非传统OCR,不适用于传统场景。其最大意义是解决大模型上下文长度问题,通过文字片压缩解压提高处理速度。模型功能多样,是让AI思考的新思路。

开源AI项目落地
开源动态8

中英双语、29项第一、像素级理解:360 FG-CLIP2登顶全球最强文跨模态模型

360推出FG-CLIP2文跨模态VLM模型,在八大类任务、29项测试中超越Google与Meta。它能像素级,中英文皆强且已开源。其优势源于高质量数据集和先进训练方法,还在多业务落地并开放API。

机器之心
开源动态7

Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板

Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。

InfoQ
算法论文8

BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让像生成学会「边想边改」丨ICLR 2026

BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化文表示,提升复杂像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。

AI科技评论
产品应用7

Anthropic重磅更新skill-creator:创建skill全面告别“草台班子”时代

Anthropic升级skill - creator,让普通人创建skill更友好且有效。将测试等机制引入创作,能验证skill有效性。还支持多智能体并行测试、A/B测试,优化触发描述,为未来自然语言定义skill过渡。

AI寒武纪