评估框架」共找到 2216 篇相关文章

开源动态8

消费级显卡可以快速上手跑!面壁智能MiniCPM-o 4.5发技术报告

面壁智能联合多方发布MiniCPM-o 4.5技术报告。该模型是业界首个端到端全双工全模态大模型,参数约9B,依托Omni - Flow框架,多项性能对标前沿大模型,还推出多种使用方式,兼顾普通用户与开发者需求。

量子位
新闻资讯7

全民拜龙?我看是大厂“套壳大战”搞疯了

OpenClaw是开源AI Agent框架,引发全民热潮,中国大厂纷纷推出套壳产品。国产套壳产品上手难度低,但也存在问题。傅盛基于此养出AI团队,猎豹移动市值涨24%。不过,OpenClaw存在安全问题,背后是Token入口争夺战。

鲸选AI
算法论文7

视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K

视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。

带你学AI
推荐文章8

用系统架构思维,告别“意大利面条式”系统提示词

本文作者分享编写系统级提示词经历,指出‘规则清单式’设计有规则打架、维护难、价值稀释问题。引入系统架构思维,构建四层设计框架,给出编译原则与模板,还重构‘AI编程助手’提示词,实现从‘规则管理者’到‘系统设计师’转变。

阿里云开发者
算法论文8

哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理

哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。

AIGC开放社区
开源动态8

第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力

新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型。

新智元
算法论文7

用超图撕开知识边界:16万节点无师自通搞Agentic科研

传统知识图谱只能用三元组描述世界,难以应对真实科学场景里的多体交互。作者提出将文献里n元关系存成超图超边,让LLM在多智能体框架里‘沿着超边走路’,并构建了超图进行实验,实现可验证的科学发现。

PaperAgent
产品应用7

数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手

文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。

阿里云开发者
算法论文7

LLM已能自我更新权重,自适应、知识整合能力大幅提升,AI醒了?

近期,AI自我演进话题研究讨论渐热。OpenAI奥特曼畅想AI自我改进未来,有爆料称其内部运行递归式自我改进AI。MIT论文提出SEAL框架让LLM自我更新权重,引发热议,实验显示其有提升但也有局限。

机器之心
算法论文8

密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25

清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。

量子位