自动化评估工具」共找到 2870 篇相关文章

开源动态8

SimpleTIR:让大模型“边写代码边思考”不再崩溃

SimpleTIR可解决多轮工具调用中训练崩溃问题。作者指出崩溃原因是分布偏移、低概率token链式雪崩和梯度爆炸。它采用void turn过滤,掐断崩溃链路,训练稳定,还催生多样推理行为,且工程友好已开源。

AI科技评论
算法论文8

从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench

港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营
算法论文7

利用大模型检测钓鱼邮件:方法,效果及数据集

随着企业安全防范增强,钓鱼邮件成重要攻击手段,大模型检测方法盛行。日本论文详细披露检测方法和实验数据,含解析解码、简化邮件、生成prompt、调用LLM四步,还介绍数据集及评估了四个模型效果。

AI与安全
新闻资讯8

2025年4月17日消息,OpenAI 连发o3和o4 mini,o3为强大推理模型,o4-mini专为高效推理优化。它们能调用ChatGPT工具,可基于图像思考。OpenAI还开源本地代码智能体Codex CLI,兼容所有模型。

鱼羊
新闻资讯7

老黄玩Nano Banana上瘾,拉着哈萨比斯大夸特夸,“不会有人不喜欢吧?”

英伟达CEO黄仁勋公开宣称是Nano Banana的忠实粉丝,还向DeepMind CEO哈萨比斯大夸特夸。他也常用多种AI工具处理事务,提升效率。Nano Banana有新玩法,让Gemini走红,拉下ChatGPT下载量榜首。

量子位
新闻资讯8

Anthropic深夜连放两弹:Sonnet 5、全新AI科研App重磅上线

Anthropic 深夜发布两个重磅更新:Claude Sonnet 5和面向科研人员的AI工作台Claude Science。Sonnet 5性能接近Opus 4.8,提升Agent能力且价格低;Claude Science整合科研工具,支持复现产出、自动管理算力、多学科查询。

AI寒武纪
新闻资讯7

全球首富红眼All in!马斯克600亿收购Cursor,挤上ASI末班车

SpaceX签署最终协议,600亿全股票收购Cursor母公司Anysphere。马斯克的xAI发展不顺,而Cursor被Anthropic打压。编程工具赛道已三分天下,Cursor是独立入口,马斯克此举是为搭上ASI末班车。

新智元
产品应用8

写顶会LaTeX论文的门槛彻底被谷歌PaperOrchestra打下来了~

谷歌推出多智能体协作框架PaperOrchestra,能将非结构化研究素材转化为符合顶会要求的LaTeX投稿论文。它解决了现有自动化研究框架在论文写作环节的问题,实验显示全面超越现有基线。

PaperAgent
新闻资讯7

OpenAI 收购了自己的“甲方”公司

当地时间12月3日,OpenAI宣布收购Neptune.ai,该公司为企业提供AI模型训练跟踪工具,OpenAI本就是其客户。虽未披露财务条款,但报道称将以不到4亿美元股票支付,交易仍需满足成交条件。

InfoQ
新闻资讯7

狙击Gemini 3!OpenAI发布GPT-5.1-Codex-Max

Gemini 3力压全场,OpenAI发布GPT-5.1-Codex-Max应对。它突破上下文窗口限制,能连续工作超24小时,在METR达新SOTA,推理更快,还推出xhigh推理力度选项,已支持与多种工具结合。

量子位