「GPT - Image - 2」共找到 2734 篇相关文章
字节发布通用游戏智能体!5000亿token训练,用鼠标键盘吊打GPT-5!
字节seed团队打造通用游戏智能体Game-TARS,基于键盘—鼠标动作空间训练,用超5000亿标注量级数据,结合新技术提升扩展性和泛化性,在多类游戏任务中表现超越GPT - 5等模型。
GPT-5.4暴击华尔街!白领工作灭绝时刻,美国5.7万科技岗位被血洗
OpenAI发布GPT - 5.4震惊AI圈。它能力超强,能颠覆白领工作,如让Excel变数据分析平台、超越咨询投行律所。美国科技行业岗位大减,但AI岗位需求飙升,诺奖得主警告AI会加剧不平等。
社区供稿 | 开源SOTA:阶跃发布端到端语音大模型Step-Audio 2 mini!
阶跃星辰发布最强开源端到端语音大模型 Step - Audio 2 mini,在多个国际基准测试集获 SOTA 成绩。它统一建模语音理解等,率先支持语音原生 Tool Calling 能力,架构创新,案例展示其多方面强大能力。
LLM开源2.0大洗牌:60个出局,39个上桌,AI Coding疯魔,TensorFlow已死
9月13日蚂蚁集团开源团队发布LLM开源2.0全景图,收录114个项目,39个新晋、60个出局。生态洗牌,Agent层活跃,分类架构细化。AI Coding等领域发展显著,TensorFlow不敌PyTorch,还梳理厂商大模型发布情况。
理解、生成、编辑一次搞定:Skywork UniPic 2.0的统一多模态解法|甲子光年
电商团队常面临创作流程繁琐问题,当前行业需统一架构。昆仑万维发布Skywork UniPic 2.0,整合理解、生成、编辑功能。它参数小性能优,还构建奖励模型,配合其他模型构建体系,具成本等优势。
AI视频生成走向「演技生成」时代,生数科技Vidu全球发布Vidu Q2
9月25日,生数科技全球上线新一代图生视频大模型Vidu Q2,打破AI生成表情假、动作飘忽等问题,实现从“视频生成”到“演技生成”跨越,有AI演技生动、镜头语言丰富等亮点,已多端上线。
OpenAI首个GPT-5找Bug智能体:全自动读代码找漏洞写修复
OpenAI发布由GPT - 5驱动的白帽Agent——Aardvark,能在大规模代码库自动发现并修复安全漏洞。它不依赖传统技术,工作流程清晰,已开启内测。10月多家科技巨头也布局Agentic AI + 代码安全。
CapRL:用强化学习突破Image Captioning训练瓶颈,3B模型性能媲美72B
上海人工智能实验室联合团队发布 CapRL,首个将 DeepSeek - R1 强化学习策略用于 Image Captioning。CapRL - 3B 模型在图像描述任务媲美 Qwen2.5 - VL - 72B,已开源,团队持续迭代优化。
LLM 长文本处理的“不可能三角”?我们用 E2LLM 把它破解了!
长文本理解与推理是LLM的难题,存在效果、速度、兼容性的“不可能三角”。蚂蚁集团和华东师范大学提出E2LLM新范式,实现三者平衡,在效果和效率上表现出色,开启长文本处理新篇章。
Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!
Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。