「免真值评估」共找到 811 篇相关文章
OpenAI推出免费的、LaTeX 原生科研写作神器Prism
OpenAI推出免费科研写作工具Prism,可理解为“AI增强版的Overleaf”,整合LaTeX编辑器、协作工具和AI助手。它原生支持LaTeX,能云端实时协作,内置GPT - 5.2,即日起ChatGPT个人账户用户可访问。
SGLang原生支持昇腾,新模型一键拉起无需改代码
12月20日SGLang AI金融π对收官,聚焦大模型推理效率。昇腾成SGLang原生支持后端,助DeepSeek等模型免调参运行。SGLang给出推理系统工程解法,昇腾与SGLang深度共建,性能优且全面拥抱开源。
腾讯混元数字人团队发布Moral RolePlay基准,揭秘大模型的「道德困境」
腾讯混元数字人团队和中山大学推出「Moral RolePlay」测评基准,评估大模型扮演多元道德角色能力,揭示顶尖AI模型演不好反派,暴露模型理解社会心理复杂性的局限,还给出未来对齐技术方向。
一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事化视频生成
新加坡管理大学等提出开源全能多智能体框架UniVA,可统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。
首个自主数据科学的智能体
DeepAnalyze是业界首个能自主完成数据科学任务的智能体大语言模型,可自动执行数据准备、分析等任务,支持多种数据源,且模型、代码等全部开源,还给出了使用和开发方法。
一个指令误导智能模型!北航等首创3D语义攻击框架,成功率暴涨119%
北京航空航天大学与中关村实验室团队提出全新框架InSUR,入选NeurIPS 2025。该框架可基于指令生成对抗样本,首次实现3D SemanticAE生成,从采样、建模、评估三方面突破,实验验证其有效性与可扩展性。
AI牛马实现“干中学”!上海AI Lab联合推出智能体自我进化新框架
上海人工智能实验室等研究者提出MUSE智能体框架,让智能体实现“干中学”。它围绕分层记忆模块,通过先做、再反思、然后进化,解决现有智能体痛点,实验表现出色,还展望了未来优化方向。
2025乌镇峰会看点:人工智能,中国数字世界秩序之巅
2025年世界互联网大会乌镇峰会是战略转折点,议程、展览等聚焦AI,从宽泛论坛变为展示AI驱动发展模式平台。报告剖析议程架构、战略差异,评估其对全球AI格局等多方面的影响。
OpenAI最新开发者“全家桶”:Apps SDK、Agent Builder、ChatKit深度解读与实测
长假期间,OpenAI在2025 DevDay宣布开发者生态重大升级,引入“Apps in ChatGPT”及其SDK和AgentKit工具集。文章深度解读Apps SDK、Agent Builder、ChatKit,介绍功能、使用方法和体验,还提及OpenAI的AI大平台战略。
和知乎一起,推出了个 AI 先行者榜单
知乎发起AI先行者榜单评选,与作者合作。提名公开透明,来自社区征集。评选从多维度评估,综合各方评分推出首期榜单。活动非一次性,后续每季度都有,鼓励更多人参与。