「GPT - 2 Small」共找到 2700 篇相关文章
DeepSeek最新模型意外泄露~
DeepSeek最新模型DeepSeek-V3-0526疑似泄露,消息源于https://docs.unsloth.ai/basics/deepseek-v3-0526-how-to-run-locally ,其性能媲美GPT - 4.5 / Claude Opus,或成最强开源模型,信息若属实将很快发布。
ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式
北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。
AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起
文章梳理大语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。
突发!字节开源 36B 模型Seed-OSS
字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在多方面表现强劲,性能碾压OpenAI开源模型。
来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!
OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。
谷歌Gemini火力全开!实测:原生图像生成新升级确实强
谷歌Gemini原生图像生成功能升级,图像质量更好、文本渲染更准、生成速度更快。可融合图片元素、实时编辑等,能免费试玩,开发者可集成API。实测表现惊艳,也有翻车情况,还能搭配Gemini 2.5 Pro。
马斯克曝光Grok 5!1.5万亿参数,偷师Cursor狂练编程
5月25日凌晨马斯克官宣,1.5万亿参数Grok V9-Medium训练完成,2 - 3周后发布。训练灌入大量Cursor编程数据,编程能力将大幅提升。此前v8 - small年底前开源,马斯克编程赛道布局全面摊牌。
多模态推理新范式:上海AI Lab新作证明“画”出答案比“说”出答案更靠谱
上海人工智能实验室等联合提出DiffThinker模型,利用扩散模型构建全新视觉推理范式。它在视觉中心任务上表现优异,准确率碾压GPT - 5等模型,还能与MLLM协同推理实现1 + 1 > 2的效果。
Cursor一夜翻车,AI 300万代码写浏览器被打假!全网群嘲「AI泔水」
Cursor宣称GPT - 5.2连肝7天造出浏览器,但开发者发现其代码无法编译,是缺乏工程逻辑的“AI泔水”。这一行为激怒开发者,也揭示AI编程需明确分工,未来软件开发靠“开挂工程师”带领AI。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。