「大模型评估」共找到 9484 篇相关文章
a16z:AI 产品初期用户流失高很正常,M3 留存才是评估 PMF 的关键
a16z研究团队分析数百家AI企业后发现,将衡量用户留存率基准点从M0后移至M3,能更清晰评估PMF和GTM策略。AI产品留存曲线分获客、留存、扩张三阶段,M12/M3比率是预测长期留存关键指标。
AIAAJ | 西工大张巧、张伟伟等:多专家特征融合网络架构预测跨声速抖振气动噪声
为解决气动噪声数据中流动状态与空间位置分布不平衡导致的MLP预测精度不足问题,本研究提出多专家特征融合网络架构,以跨声速抖振气动噪声为算例评估,可降低MLP算法MSE,泛化性更好。
500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式
香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
2025 IMO真题撕碎AI数学神话,全球顶尖模型齐翻车!冠军铜牌都拿不到
2025 IMO数学竞赛中,全球顶尖AI模型均翻车。冠军Gemini 2.5 Pro仅得31分,连铜牌都拿不到。Grok - 4表现糟糕,DeepSeek - R1也令人失望。AI虽有思路,但逻辑细节不足,离成奥数大师尚远。
智能体编程“小钢炮”:Qwen3.6-35B-A3B开源!
Qwen3.6-35B-A3B开源,是稀疏MoE模型,总参350亿、激活参数30亿,轻量高效,在智能体编程等方面表现卓越,超越前代,可与稠密模型媲美,支持多模态,已在Qwen Studio上线并发布开源权重。
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。
空间智能新高度:港科大谭平团队SAIL-Recon突破万帧级图像大规模3D场景重建Transformer
香港科技大学谭平教授团队与地平线团队发布3D场景表征与大规模重建新方法SAIL - Recon,突破现有模型处理能力瓶颈,可实现万帧级场景表征抽取与定位重建,在多数据集上表现优于现有方法。
谷歌Gemma 4全系开源:3.8亿激活超越20倍体量模型,手机秒变AI工作站
谷歌发布Gemma 4全系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试中成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。
AIGC超新星专栏丨玩AI的小笼包:我离开互联网大厂,用AI重新定义“内容总监”
北京AIGC视听产业创新中心对话‘玩AI的小笼包’。她曾是大厂内容负责人,后投身AIGC创作。她分享了创作转型经历、‘超创’生态及工业化生产流程,也谈及技术挑战与行业发展方向。