评估优化」共找到 1857 篇相关文章

新闻资讯7

OpenAI官方GPT-5 提示词泄露:这套“反向Prompt”技巧,让模型听话得像条狗。

GPT5提示词被破解,结合官方《GPT - 5 Prompting Guide》有不少技巧。如Metaprompting让GPT - 5优化Prompt,指导AI编码可明确知识、培养自信等,还有控制AI主动性的方法。

探索AGI
新闻资讯8

不卷AlphaFold,OpenAI首个生命科学模型杀出,单项超越95%专家

OpenAI发布首款生命科学模型系列GPT - Rosalind,在RNA预测任务上超越95%人类专家。它针对科研工作流优化,还推出插件连接多数据库和工具,与药企巨头合作,和AlphaFold是互补关系。

新智元
新闻资讯7

「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库

2025年国内AI产品领域涌现诸多关键词,对应多款颠覆性产品。量子位智库2025年度「AI 100」榜单开启招募,分三大板块,采用定量与定性结合评估体系,还公开自研AI产品知识库。

量子位
产品应用7

蚂蚁集团发布KAG-Thinker,多跳问答慢思考,医疗领域拿下87分

在LLM问答领域,多跳问题存在局限性,现有方法缺乏严谨性等。KAG - Thinker是基于KAG框架的模型,将复杂问题分解,通过多模块优化知识获取,在医疗领域实用,稳定性也出色。

PaperAgent
开源动态8

叶子豪、陈天奇等人开源项目FlashInfer入选,MLSys2025最佳论文奖公布

近日,MLSys 2025公布最佳论文奖,FlashInfer等入选。FlashInfer由多机构合作发起,是灵活的LLM推理内核库,优化内存访问、有可定制模板和调度机制,性能提升显著。另一获奖论文提出Negativa - ML可消除ML框架臃肿。

机器之心
产品应用7

The Batch:831 | 机器翻译正在实践中发挥作用

人工智能为语言学习应用巨头 Duolingo 带来生产力提升,借助生成式 AI 构建 148 门课程,总量翻倍。其 AI 辅助课程构建法能快速转化多语种版本,还在评估多模型,不过此举也引发批评。

DeeplearningAI
算法论文8

首个英文原生「弱智吧」!逻辑谬误数据集与生成框架来了 | AAAI'26

研究发现大模型判断逻辑谬误易误报正常句子,但分类能力较强。研究人员构建英文逻辑谬误基准SMARTYPAT - BENCH,开发生成框架SMARTYPAT,为大模型逻辑评估提供新思路,可用于多领域。

新智元
新闻资讯7

研究表明,开源能推动AI创新和经济增长

Siliconangle消息,Linux基金会新研究显示开源对全球经济贡献达9万亿美元。其首席经济学家Frank Nagle指出,AI加入使开源价值评估方式改变,计算开源AI价值复杂,参与开源项目能增加经济价值。

AIGC开放社区
算法论文7

正确答案 ≠ 正确推理,CoT 或成大模型推理能力停滞的「罪魁祸首」?

研究指出当前大模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年大模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。

AI科技评论
新闻资讯7

Anthropic 提出透明度框架以保障前沿 AI 发展

Anthropic提出新透明度框架,针对大型AI公司,实施安全开发框架评估并减轻潜在风险,要求公开披露SDFs和系统卡片,小型公司豁免,还设执行合规条款,旨在平衡安全与创新。

InfoQ