「多模态评估」共找到 1558 篇相关文章
又一个Kimi K3下周开源!Qwen3.8-Max编程、办公、科研都能自己干了
Qwen3.8-Max是Qwen家族迄今最强模型,2.4万亿参数,下周将开源权重。它在多项基准测试中表现出色,能连续自主工作数天,在编程、办公、科研、长周期任务、多模态等方面全面提升。
刚刚国产双响炮炸场!智谱「牛来模型」和阿里Qwen3.8-Flash双双亮相屠榜
智谱发布GLM - 5.3 - Flash(牛来模型),原生多模态,支持1M token上下文,运行在国产芯片,价格实惠。阿里开源Qwen3.8 - Flash - Next权重,成本低性能优,在四大维度重构架构。
硅谷豪赌算力烧到停电,中国团队反向出击!这一刀,直接砍碎Scaling Law
硅谷陷入算力战争,OpenAI、马斯克等豪赌Scaling。但Anthropic指出模型大、算力多不一定聪明。Yuan 3.0 Flash登场,用RAPO+RIRM解决过度思考,降低推理token,在多模态任务表现出色,引发开发者关注。
英伟达Jim Fan:「世界建模」是新一代预训练范式
英伟达机器人主管Jim Fan判断,继“下一个词预测”后,世界建模将成新预训练范式,2026年大世界模型将为多模态AI奠基。他还讨论世界模型定义、应用,展望新推理形式,业内人士也各抒己见。
你的论文有novelty吗?复旦搞了个顶会论文查新系统
复旦大学NLP团队与WisPaper合作研发OpenNovelty系统,用于论文新颖性评估。系统基于大语言模型,强调证据与可验证性,有四步分析流程,已分析1360篇投稿并公开报告,有辅助作用但有局限。
The Batch: 892 | 教育应与 AI 协作,而非对抗
三年多前ChatGPT发布,教育改变。曾寄望用AI检测器识别生成文本,但学生易规避。检测难维持信任,还可能惩罚错对象。生成式AI可提升学习,应构建新评估模型,如展示真实理解等。
Sora爆火之际,这家AI公司的DAU正以每月翻倍速度狂奔——Agnes
OpenAI的Sora爆火,而AI Agent产品Agnes正走不同路线。它三个月内全球注册用户破百万,DAU逼近10万,ARR达780万美元且近乎每月翻倍。其多模态社区预计10月上线,追求“Vibe Lifestyle”理念。
阿里Qwen悄悄放出6个开源权重,国庆卷疯了~
国庆期间,阿里通义千问悄悄放出6个开源模型权重,Qwen3-VL是通义千问系列最强大的视觉 - 语言模型。其30B版本多模态表现媲美GPT - 5 - Mini等,功能与架构均有升级。
CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己
美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。
从文心开源谈起,论大模型发展新生态
6月30日百度宣布开源ERNIE 4.5即文心4.5系列模型,实现预训练权重+推理代码完全开源。文心团队提出创新架构,增强多模态理解能力。今晚7:30,CSDN邀专家深度解读文心开源及行业趋势。