「小模型超越大模型」共找到 8313 篇相关文章
员工每天花1000美元也要用ClaudeCode!创始人:太贵了,大公司专属,但它比 Cursor 猛!
Claude Code处理大型代码库能力强,但价格贵,有用户称能力超Cursor。其创始人分享设计理念、使用方法等,还提到它基于Claude 4系列模型有新变化,可在GitHub等场景用,未来会拓展工具协同和小任务处理。
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
GPT-5两周内发布,内测猛料流出?GPT-6或已开始训练,奥特曼剧透百万GPU
有爆料称GPT-5将在两周内发布,是多模型组成的系统,含「路由器」,GPT-6已在训练。奥特曼称年底将增超百万GPU,有人看好GPT-5,也有人认为它可能只是路由器。此外,OpenAI有十名员工拒小扎3亿天价offer。
新一代AI教师是什么样?学而思让它从L2「助手」跃迁至L3「老师」
在AI应用落地成关键的当下,教育成AI融合创新前沿。好未来CTO田密提出「AI教师L1 - L5分级」理论,指出当前AI老师达L2水平,L3正演进。学而思学习机的「小思AI一对一」迈向L3,依托硬件和自研大模型,结合优质内容,从可用走向可信。
「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了
近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。
Agent、图像、视频全是大版本升级:春晚还没开,豆包AI就火了
2026年AI市场竞争激烈,海外公司密集发布新模型致华尔街震动。国内腾讯、阿里、字节参战,字节官宣豆包参与春晚互动。2月14日火山引擎宣布豆包系列模型全面升级,含大模型2.0、图像模型Seedream 5.0 Lite、视频模型Seedance 2.0。
从今天起,开源前五,全!是!中!国!大!模!型!
短短一年,LMArena开源模型榜单前五全被中国大模型占领,智谱Z.ai登顶,阿里、DeepSeek等紧随其后。LMArena是权威评测平台,盲测机制保证排名真实。中国模型性价比高,正用开源和低价占领市场。
视觉强≠能干活!清北普林斯顿等开源WorldArena,世界模型评测被颠覆
2026 年 2 月 13 日,清华、北大等顶尖机构联合推出的 WorldArena 面向全球开源。这是首个‘功能 + 视觉’统一评测体系,撕开了‘美丽视频’伪装,让评测从‘审美导向’走向‘功能导向’。
马斯克掀桌子了,最强开源大模型诞生!Grok-2近万亿参数性能首曝
xAI官宣向所有人开源Grok - 2,其有9050亿参数、128k上下文窗口等强大技术规格。还梳理了开源部分、技术特点、权限等,介绍使用方法,网友和大佬高度评价,马斯克预告后续计划。
刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。