自动化评估工具」共找到 2870 篇相关文章

新闻资讯7

再见,程序员!马斯克宣判:奇点就在2026

马斯克断言2026年是奇点之年,起因是Claude Code强大的编程能力引发关注。Claude Opus 4.5表现优异,碾压其他模型。奇点来临,人们工作方式将改变,AI或使软件开发自动化

新智元
新闻资讯8

刚刚,云计算一哥出手,大家AI Agent自由了

亚马逊云科技在re:Invent大会发布诸多面向Agentic AI的成果,包括Strands Agents SDK更新、模型定制工具等,还介绍了构建Agent的四个方面,展示了完整蓝图,指引AI时代新方向。

机器之心
算法论文8

解放军总医院联合南大、吉大等机构,共同提出首个「脊柱诊疗大模型」SpineGPT

解放军总医院联合多机构研发首个脊柱诊疗大模型 SpineGPT。研究指出通用 LVLM 有‘认知鸿沟’,团队构建 SpineMed 生态系统,含 SpineMed - 450K 数据集与 SpineBench 评估基准,SpineGPT 表现超越开源模型。

机器之心
算法论文8

为什么 LLM 搞不定复杂任务?ReAct 与 Reflexion 技术综述

文章指出大语言模型处理复杂任务存在事实幻觉、缺乏实时信息等问题。介绍ReAct将推理和行动结合,及Reflexion在其基础上添加评估反思机制,探讨两者结合优势,还提及未来发展方向。

阿里云开发者
算法论文8

通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果

阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。

深度学习自然语言处理
新闻资讯7

AI行业的底牌已经亮完了,模型能力趋同后,拼什么?

Databricks MVP Adi Polak分析AI人才需求,指出能搭建评估管道等的工程师是硬通货。前沿模型架构趋同,行业从技术竞赛转向生态战争,比拼产品和用户理解能力,还为转型工程师给出建议。

AI工程化
7

编程“学废”了?普渡毕业却只获烤肉店面试!美国IT失业创新高:AI面试成最大屈辱,网友怒称宁愿失业!

随着AI编程工具普及和科技大厂裁员,美国计算机领域黯淡,应届生求职梦碎。2025年美国IT就业疲软,失业率创新高。毕业生陷入AI“恶性循环”,AI面试也让求职者体验糟糕,有人担忧信息泄露。

AI前线
算法论文8

从Debugger到Developer : 低代码时代新基准NoCode-bench,SWE-Bench作者力荐

浙江大学牵头联合多机构推出全新评估基准NoCode - bench,直面自然语言驱动功能添加任务,发现当前最佳LLM成功率仅两成。它构建严谨,任务挑战大,指明AI软件开发改进方向,且已开源。

机器之心
产品应用7

The Batch:834 | 更一致的人物与风格

德国 Black Forest Labs 的 FLUX.1 Kontext 系列文本生成图像模型,可可控编辑图像。有 max、pro 和 dev 版本,功能含角色一致性和图像编辑,在测试中表现优,公司计划公开专有评估基准。

DeeplearningAI
新闻资讯7

AI 视频生成时代,留给人类的只有演技?

社交媒体疯传AI换脸视频,可实现零成本「无限角色互换」,还能精准捕捉微表情。快手Kling Motion Control等工具受关注,能低成本完成专业镜头。价格亲民,技术进步大,但也引发诈骗等担忧。

机器之心