结构化评估」共找到 1779 篇相关文章

新闻资讯8

刚刚,Claude独立攻克图论猜想,仅用31步!算法祖师爷高德纳震惊发文

Claude Opus 4.6仅用31步独立攻克图论猜想,算法祖师爷高德纳震惊发文,认为需重新评估生成式AI在数学研究中的作用。这标志着AI在自动推理和解决创造性问题上达到新里程碑。

新智元
算法论文8

定位大模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆

此前学术界发现大模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科大等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。

量子位
开源动态8

NeurIPS 2025 | Code Graph Model:重塑代码大模型架构,利用“代码图”突破仓库级编程瓶颈

在 NeurIPS 2025 上,蚂蚁全模态代码算法团队展示「Code Graph Model (CGM)」,它将代码库图结构注入 LLM 底层注意力机制,打破业界刻板印象,在权威榜单上表现出色。文章解析其架构、训练策略和配套框架。

AINLPer
产品应用8

AI时代的天工开物:分子之心掀起生物经济“操作系统”革命 | 甲子光年

生物经济正迈向工程时代,分子之心作为AI蛋白质设计领军企业,携核心产品MoleculeOS入驻礼来上海创新孵器。该平台升级后能力强大,还在构建生物经济‘新基建’,解决产业难题。

甲子光年
算法论文7

刚刚,OpenAI发长篇论文:大模型幻觉的原因找到了~

OpenAI发论文揭示语言模型出现幻觉的根本原因,即训练和评估过程奖励猜测而非承认不确定性。预训练阶段就埋下幻觉种子,后训练阶段‘考试机制’强幻觉,还给出改评分规则的解法。

PaperAgent
开源动态8

牛B, 我真的起飞啦,6.4k Star Bright Data CLI~~~~

约6.4k Star的Bright Data CLI想解决AI Agent访问网页难题,把网页变成易被模型读懂的材料。它将网页访问能力拆成终端可组合动作,还关注工程细节,让Agent上网有章可循。

小华同学ai
产品应用8

坏孩子浏览器来了!让AI直接用你的账号上网,好用到爆!

“坏孩子浏览器”让AI Agent直接用浏览器账号上网,无需API key和写爬虫,通过Chrome插件+CDP操控真实浏览器。支持36个平台、103个命令,与其他方案相比优势明显,还能10分钟CLI任何网站。

GitHubStore
推荐文章8

大模型Agent的核心还是prompt? 目前有什么挑战?

文章指出大模型Agent核心并非Prompt,而是工程架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。

深度学习自然语言处理
新闻资讯7

以后手机不用插卡了?eSIM手机来了!

近期eSIM手机成热点,它用电子数据文件替代物理卡片,无需插卡就能开通网络服务,让设备更轻薄。三大运营商获eSIM手机商用试验批复,暂不支持线上办理,苹果、华为等厂商机型将上市。

街头巷尾
算法论文8

超越90%城市规划师!清华、MIT等提出人机协作新范式 | Nature子刊

清华大学联手MIT等机构提出「大语言模型+规划师」新框架,让AI作「智能规划助手」。框架含概念设计、方案生成、效果评估三阶段,实验显示AI表现超九成人类规划师,未来将人机协同。

新智元