哥大团队」共找到 7284 篇相关文章

算法论文8

首个英文原生「弱智吧」!逻辑谬误数据集与生成框架来了 | AAAI'26

研究发现模型判断逻辑谬误易误报正常句子,但分类能力较强。研究人员构建英文逻辑谬误基准SMARTYPAT - BENCH,开发生成框架SMARTYPAT,为模型逻辑评估提供新思路,可用于多领域。

新智元
算法论文8

新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o

过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。

深度学习自然语言处理
推荐文章7

OpenClaw安全有救了!不改内核、无视AI内部逻辑,数学级枷锁驯服暴走智能体

OpenClaw等智能体能力强但有安全黑洞,南方科技学和香港科技团队推出ClawLess框架,从底层系统调用源头扼杀智能体出格行为,通过形式化验证、物理隔离、动态验证等手段保障安全。

AIGC开放社区
算法论文8

警告:你的Agent可能无法"解决"真实世界的视觉问题

文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战

深度学习自然语言处理
算法论文8

Evaluation is All You Need:评估设计的微小差异如何扭曲结果

论文以DeepSeek - R1 - Distill系列模型为例,指出模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动,削弱模型对比可信度,呼吁建立新评估标准。

深度学习自然语言处理
算法论文8

Kimi新架构让马斯克叹服!17岁高中生作者一战成名

17岁高中生陈广宇作为共同一作的论文提出Attention Residuals技术,将注意力机制“旋转90度”。该技术可让模型“回头看”,经Kimi Linear 48B模型验证,训练效率提升25%,推理延迟增加不到2%。

量子位
开源动态8

一个程序员失业了:他用AI重构了整个公司,结果杀疯了!

The Agency是拥有50+专业AI代理的开源项目,能让个人和小团队零人力成本获公司职能,相比传统雇佣,运营成本降99%。它有各部门专业代理,支持多工具集成,应用场景广,使用方法简单。

小华同学ai
算法论文7

AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?

研究人员提出自动售货机运营模拟环境Vending - Bench,测试模型智能体管理业务能力。实验显示不同模型性能方差,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动

新智元
产品应用7

加拿丛林迷路五小时,ChatGPT救命神技,比地图还靠谱!

一群人在加拿森林迷路5小时,手机电量低、Google Maps失灵,靠向ChatGPT发实时坐标获导航指引脱险。此外,上海交团队推出PathGPT,用模型让导航可自然对话,虽有不足但潜力

新智元
算法论文8

训练加速1.8倍,推理开销降78%!精准筛选题目高效加速RL训练丨清华KDD

清华学THU-IDM团队与慕尼黑学CompVis团队合作提出MoPPS框架,解决强化微调代价高问题。它精准挑题,预测难度,开销低、动态适应且平衡探索利用,在多任务表现佳,降本增效,有新范式。

量子位