K2.5模型」共找到 9186 篇相关文章

开源动态8

超越谷歌Banana,字节联合香港中文大学等高校开源最强图像编辑生成系统DreamOmni2

香港多高校与字节跳动联合研发的DreamOmni2系统,实现图像编辑与生成领域SOTA。它用三步造出高质量数据,提出索引编码等方案,联合训练模型,实际效果超越部分商业模型,为AI创作带来新可能。

AIGC开放社区
开源动态8

小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度

小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型

量子位
算法论文7

一句话,性能暴涨49%!马里兰MIT等力作:Prompt才是大模型终极武器

马里兰大学、MIT、斯坦福等机构研究发现,AI性能提升一半靠模型,一半靠提示词。他们让DALL - E 2和DALL - E 3 PK,发现DALL - E 3性能提升中,模型升级贡献51%,提示词优化贡献49%。

新智元
开源动态8

Google开源黑科技!不用训练的时间序列预测模型,17.9K Star 疯狂追捧!

Google Research团队开源的TimesFM时间序列预测模型获17.9K Star。它零训练、开箱即用,基于1000亿时间点预训练,涵盖多场景数据,还能给出置信区间,已集成到Google多个产品。

开源星探
产品应用8

谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...

谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。

AI寒武纪
推荐文章7

反常识!GPT-5和Opus 4同时翻车:AI越强,越不爱用工具?

作者用GPT - 5和Claude Opus 4做进化实验,让其开发工具。两模型表现出色,但面对实际任务却不用自制工具。原因包括模型规模使脚手架工作无价值、RLHF带来工具厌恶、逼近AGI渐近线等。

探索AGI
新闻资讯7

Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2

Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。

新智元
新闻资讯7

GPT-5、Grok 4、o3 Pro都零分,史上最难AI评测基准换它了

AAI机构提出新基准FormulaOne,让GPT - 5、o3 Pro等前沿大模型集体得零分。该基准含220个图结构动态规划问题,分三类难度。测试结果显示,模型在深层及最深层难度表现差,引发关注。

机器之心
开源动态8

AI给你的总是平庸答案?5.8万星插件证明:问题不在模型,在你

GitHub上5.8万星的`taste-skill`仓库,无模型代码,仅用文本规则让AI编程工具输出更有品味。揭示AI默认给平庸答案是概率采样结果,还给出反中位数三问及AI时代变贵的是判断力。

AI Reading Hub
开源动态8

阿里再开源,全球首个MoE视频生成模型登场,电影级美学效果一触即达

继上周开源三连发后,阿里昨晚开源全球首个 MoE 架构视频生成模型 Wan2.2,具电影级美学控制能力。它有 MoE 架构创新等四大技术亮点,可在 Hugging Face 和阿里魔搭社区下载。

机器之心