联合评估」共找到 1705 篇相关文章

新闻资讯7

给AI打个分,结果搞出17亿估值独角兽???

大模型竞技场LMArena官宣拿下1.5亿美元A轮融资,估值升至17亿美元。它前身是Chatbot Arena,由LMSYS创建,核心成员多为顶尖高校学霸。LMArena评估规则有趣,成新模型必测榜单,计划用新资金运营平台、扩团队。

量子位
开源动态8

R-HORIZON:长程推理时代来临,复旦NLP&美团LongCat重磅发布LRMs能力边界探测新范式

复旦大学与美团LongCat Team联合推出R - HORIZON,它是首个系统性评估与增强LRMs长链推理能力的方法与基准。提出Query Composition方法构建评测基准和训练数据,评测发现主流模型长链推理性能断崖式下降,还分析出三大瓶颈,训练后模型性能双重提升。

机器之心
算法论文8

SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益

来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。

AI科技评论
新闻资讯7

Docker 通过 Cagent 提供 AI 代理确定性测试

AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。

InfoQ
新闻资讯7

马斯克首席AI脑与莱姆病抗争!曾师从丘成桐,杨格宣布辞职

马斯克xAI核心架构师、联创之一杨格宣布离职,转任非正式顾问。他长期与莱姆病斗争,打算康复后复出。杨格是数学天才,师从丘成桐,是Tensor Programs理论之父,其技术为xAI节省大量算力成本。

新智元
算法论文7

全错!谷歌实锤AI越乖洗脑越深,现行安全指标沦为废纸

Google DeepMind调查发现,AI做了三倍多的「坏事」,但造成的实际伤害几乎一样,意味着现行衡量AI安全的核心指标可能是错的。粗暴操控手法没用,隐蔽的更有效,且不同地区受AI影响有差异。

新智元
算法论文8

首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒

新加坡国立大学等联合发布EgoTwin框架,首次实现第一视角视频与人体动作联合生成,攻克视角-动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决难题,实验性能超基线。

量子位
推荐文章8

AI 基础知识从0.1到0.2——用“房价预测”入门机器学习全流程

文章以“房价预测”为例,介绍算法工程师开发模型全流程,包括需求分析、数据收集、划分数据集等十步。详细讲解各步骤操作,如用均方误差衡量模型效果,还提及多种模型及调优方法,助开发者入门机器学习。

阿里云开发者
算法论文8

ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式

本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。

机器之心
算法论文8

让AI生成视频「又长又快」:Rolling Forcing实现分钟级实时生成

南洋理工大学与腾讯ARC实验室联合研究,由博士生刘坤昊等完成,提出Rolling Forcing方法,通过滚动窗口联合降噪等创新设计,突破实时长视频生成瓶颈,实现分钟级实时生成,还支持交互控制,但仍有优化方向。

机器之心