偷看答案」共找到 185 篇相关文章

产品应用8

基于阿里云 AgentLoop 的 DeepSeek Harness 评测实践

本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。

阿里云开发者
开源动态8

搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架

人大和蚂蚁的 SearchOS 研究,给出搜索智能体在长程任务中问题的答案。它借鉴数据库理念,做了多项核心设计,在开放信息检索基准评测领先,已提供多种使用方式,值得长程调研尝试。

机器之心
推荐文章7

我把斯坦福最火的一门课,做成了Prompt来帮我设计人生。

作者受《人生设计课》启发,将课程内容做成Prompt借助Claude辅助设计人生。此Prompt分四阶段,经多轮对话生成蓝图,含现状、问题、计划等,还提及原型行动和失败免疫,多位同事使用后有新感悟。

数字生命卡兹克
新闻资讯7

千问:阿里第二次“无线战争”

本文以乔布斯用 iPhone 点咖啡引出当下科技圈流行发布会点咖啡展示 AI 能力,对比过去与现在,指出数字世界核心范式从移动转向 AI。介绍阿里千问饱和式投入情况,还分析其可能借鉴拼多多、抖音策略,站在长尾对立面。

乱翻书
算法论文8

清华上交满分论文证明:强化学习并不能让大模型更会思考!

清华和上交在NeurIPS 2025的研究《Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?》获满分。研究聚焦RLVR,发现强化学习不能让大模型更会思考,推理能力上限仍由基础模型决定。

AI工程化
算法论文8

超越RAG,DRAG让LLM准确率飙升45.5%,问题越复杂能力越强

RAG技术虽能让LLM检索资料生成答案,但存在短板,听不懂话里有话。DRAG方法应运而生,有DRA和RSC两大法宝,经对比实验,它在多任务上领先,准确率大幅提升,计算开销小。

AIGC开放社区
新闻资讯8

华为乾崑 all in 启境,开启造车新模式

在华为乾崑生态大会上,启境给出了自己的答案。华为不仅技术赋能启境,还将团队、流程与之深度融合。启境目标是打造不妥协产品,成为‘六边形战士’,其愿景是塑造‘移动智能体’。

AI科技评论
新闻资讯7

谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化

昨夜谷歌向 Google AI Ultra 订阅用户推 Deep Think 功能,Gemini 2.5 Deep Think 模型获 IMO 金牌。它是多智能体模型,通过并行思维输出答案,在多领域及测试中表现佳,但网友评价不一。

InfoQ
产品应用7

一年没用Perplexity,AI搜索进化惊呆我了丨TIP 005

Perplexity Lab推出后,AI搜索实现技术成熟度拐点。作者体验其新出的Perplexity Lab,发现它进化很大,如答案数据可视化、回答可交互等,虽有亏损且价格贵,但仍是实用的AI搜索。

鲸选AI
算法论文8

华人主导谷歌SLED,论文登顶会!一键让模型学会自救

大模型常「瞎编」,传统修复代价高。谷歌在NeurIPS 2024提出SLED方法,不依赖外部知识和额外微调,将各层预测纳入考量,减少模型幻觉。实验显示,SLED能显著提升模型准确率。

新智元