「测试全流程」共找到 3890 篇相关文章
从答题到做实验:SciAgentGym让大模型进入科学工作流
复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。
阿里「快乐小马」来了,首批网友已玩疯!720P低至0.44元/秒
今天,阿里HappyHorse - 1.0开启灰度测试。它有电影级叙事质感,指令遵循能力强,能驾驭多种风格,还可一句话改视频。性价比高,720P低至0.44元/秒,让AI视频从‘玩具’变‘工具’。
今天,Anthropic偷偷移除了Pro用户的Claude Code访问权
Anthropic一度将Claude Code从Pro套餐移除,引发开发者不满,数小时后官网回滚,负责人称是小范围测试。Claude Code因高消耗或调整收费,Anthropic正修正订阅模型,这或改变开发者工具格局。
安卓党狂喜!Open-AutoGLM让手机自己订外卖、抢票、刷小红书
Open - AutoGLM是能让手机自己干活的黑科技,给手机装了「AI打工人」。它整合视觉语言模型与ADB远程操控技术,适配50 + 款主流应用,自带安全边界,普通人易安装,开发者可自定义流程。
Evaluation is All You Need:评估设计的微小差异如何扭曲结果
论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。
TabClaw:让 AI 真正读懂你的表格数据
TabClaw 是面向表格数据的 AI 分析 Agent,能让 AI 真正读懂表格数据。它核心标签是全透明与持续进化,工作流分显式和隐式两层,目标是成为真正理解用户、能一起成长的表格分析伙伴,项目已开源。
“大模型第一股”打响上市前哨战!智谱GLM-4.7 刷新开源编程SOTA,修复代码、终端操作表现超Claude 4.5
冲刺大模型第一股的智谱推出开源大模型GLM - 4.7,主打编程与代理式任务提升。它在多项基准测试中表现出色,UI质量飞跃,还采用新推理机制。智谱上市在即,但亏损扩张快,研发投入大。
谷歌Gemini-0605发布,全球大模型第一!
昨晚谷歌发布Gemini 0605版本,官方称其回归0325版本效果。该版本在多项基准测试中领先,Elo评分提升。谷歌针对反馈改进,使Gemini 2.5 Pro回答更优,还取消日期后缀,输入输出Token价格有优势。
Claude一夜杀入Excel和PPT,暴击微软Copilot!永久记忆血洗软件业
Anthropic发布Claude for Excel与Claude for PowerPoint重大更新,实现跨文件全上下文共享,以研究预览形式面向付费用户。还引入「技能」「指令」功能,能与微软Copilot协同,已超OpenAI成美企首选。
吴恩达手搓新项目:AI审稿人上线!只为终结学生“3年被拒稿6次”的痛苦
吴恩达开发新项目 Agentic Reviewer 代理审稿人,灵感源于学生3年论文被拒6次。此工具能加快研究人员迭代速度,在 ICLR 2025 评审数据测试中接近人类水平,适用于 arXiv 公开研究领域。