「小模型超越大模型」共找到 8258 篇相关文章
谷歌Gemma 4全系开源:3.8亿激活超越20倍体量模型,手机秒变AI工作站
谷歌发布Gemma 4全系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试中成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。
256块NPU训成8B视频模型、超越Sora等一众闭源!抖音内容技术团队开源ContentV
近日,抖音内容技术团队开源ContentV,这是面向视频生成任务的高效训练方案。用256块NPU约4周训成8B参数模型,在多评估维度效果与主流方案相近,还探索了有限算力下训练路径,现推理代码与权重已开放。
小美Agent:当龙猫遇到美团外卖的灾难现场
作者体验美团AI助手“小美”后吐槽不断。美团称其用有5600亿参数的龙猫大模型,能力接近GPT - 4o,但它理解需求差、操作订单无效、定位混乱。美团做AI是为跟风,未解决用户真需求,是资源浪费。
字节跳动开源视频生成模型Alive:12B参数,个人电脑也能跑
字节跳动开源视频生成模型Alive,12B参数,支持四种模式,硬件门槛低。在评测中表现出色,技术架构精心设计,解决音视频同步等问题,虽有小瑕疵,但更适合普通玩家。
倒反天罡!Gemini Flash表现超越Pro,“帕累托前沿已经反转了”
Gemini 3 Flash在SWE - Bench Verified测试中分数超Pro,速度和性价比也更优。谷歌解释是因Flash有未用于Pro的优化技术。开发者认为应停止‘旗舰版迷信’,强化学习让小模型也能实现‘降维打击’。
4o-mini华人领队也离职了,这次不怪小扎
OpenAI的Kevin Lu离职,下一站是估值120亿美元的Thinking Machine Lab。他毕业于UC伯克利,在OpenAI领导完成4o - mini,擅长小模型和强化学习。他认为应关注互联网数据,停止强化学习研究转做产品开发。
MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4
MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。
FLUX.2开源了,但是我好像也看到了小公司的无力。
AI绘图曾经的王者FLUX.2部分模型开源,包括dev和即将开源的klein。但与Nano Banana Pro对比,其生图、改图及世界知识表现欠佳。这凸显小厂在大厂资源碾压下的无力,但开源仍有价值。
聊聊 Token 出海的生意经:模型开源给世界,中国赚什么?
本文围绕中国开源模型展开,介绍了 Cursor 使用 K2.5 模型事件,阐述了开源模型供应链,分析了中国开源模型受欢迎原因,探讨小公司技术机会,还提及开源面临的挑战及未来趋势,指出其正改变全球 AI 基础设施格局。
小红书RecSys 2025最佳论文提名背后:破解视频时长预测难题
小红书推荐算法团队论文《Multi-Granularity Distribution Modeling for Video Watch Time Prediction via Exponential-Gaussian Mixture Network》在 RecSys 2025 获最佳论文提名。该文剖析视频时长预测难题,提出 EGMN 模型,线下线上验证效果佳。