「观察暴露度」共找到 525 篇相关文章
推理快30%,性能超过千亿参数模型,15B模型Apriel-1.6重新定义端侧推理
ServiceNow人工智能团队发布的Apriel-1.6-15b-Thinker,以150亿参数体量,多模态推理能力强,推理Token消耗降超30%。它在AI分析指数成绩佳,优化计算成本,还介绍了训练策略与多维度性能实测情况。
Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆
Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。
国产推理芯片,赢了英伟达?
算力市场风向生变,国产算力崛起。政策从资金、市场、规则多维度发力,为国产算力扫清障碍。在推理场景中,国产方案性价比更高。其独特分销体系使贸易环节信息透明度低,步入卖方市场,市场也迎来新局面。
Kimi K2:唯一能稳定准确生成时钟的AI模型
AI World Clocks项目让9个大模型按提示词生成每分钟更新的时钟,以观察稳定性。国产Kimi K2是唯一能稳定保持表盘与指针正确平滑转动的模型,测试显示了模型在时空概念上的能力差异。
信息熵之后,清华提出状态熵!量化分析「系统智能性」的全新视角
清华大学科研团队从自治系统的演化动力学出发,提出状态熵概念,分析其与系统聚合度关系,为系统智能性度量提供新视角。论文给出状态熵统一定义及演化解析表达式,还在典型系统上分析其演化规律。
一文看懂“存算一体”
文章介绍存算一体概念,它因传统冯·诺伊曼架构在数据爆炸、AI崛起下暴露“存储墙”“功耗墙”问题而提出。阐述其发展历程、技术路线、存储介质、应用场景,也指出技术、生态、市场方面挑战,前景潜力大。
国产Deep Research杀出一匹「裸奔」黑马:免费开放,过程透明,网页报告一键即出
国产AI搜索秘塔AI搜索放大招,深度研究功能发布即免费公开,自带新玩法,思考过程透明。在评测集上表现优,可应对复杂问题,生成规范报告,还能转互动网页,严谨度与易用性兼备。
“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节
复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。
MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告
司南评测集社区 CompassHub 收录多维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论多模态/音频大模型相关议题。
九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了
OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。