自动化评估工具」共找到 2870 篇相关文章

算法论文8

清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源大模型

大语言模型幻觉问题待解,成本与算力需求攀升。清华孙茂松团队联合深言科技提出FaithLens模型,把幻觉检测提升为整体评估,以解释作为训练信号,8B模型在多任务上超闭源大模型。

AI科技评论
新闻资讯8

AI时代,开发者不能再当 i 人了,「云计算代言人」敬告

亚马逊云科技副总裁 Jeff Barr 时隔 16 年再访中国,对比两个技术时代。他认为 AI 带来创新与挑战,开发者需强大沟通力。还介绍亚马逊云科技工具 Kiro 及新开发模式,预测未来软件开发形态转变。

机器之心
开源动态8

AI操作网页:browser-use和AI大模型互动解析

文章深入解析开源框架browser - use与AI大模型互动方式。它能自动化在线任务,靠精巧prompt设计和不同类型Message输入实现高效交互,还总结出可用于其他大模型交互场景的技巧。

阿里云开发者
新闻资讯7

AI「自我复制」能力曝光!RepliBench警示:大模型正在学会伪造身份

英国AISI推出RepliBench基准评估AI自主复制能力,分解为四大核心能力。测试显示当前AI尚不具备完全自主复制能力,但在部分子任务有进展,研究旨在平衡AI发展与安全,为技术变革导航。

新智元
产品应用7

Meta发布Muse Spark,MSL的首份答卷!Alexandr Wang通过了吗?

Meta发布Muse Spark,是MSL首个模型,经九个月技术栈重构,效率优先。它有原生多模态推理能力,Contemplating模式处理复杂查询,安全评估突出,产品功能升级,商业化转向明显,正逐步在Meta应用推出。

AI工程化
新闻资讯7

Claude Code一周份额,一天就烧完一半?有人逆向工程发现了7个bug

Claude Code在快速更新中问题频发,如思考深度大幅下降,还存在7个叠加的bug,浪费用户token配额。开发者给出应对建议,新版本增加账单透明度和缓存过期提醒,该工具正面临信任危机。

机器之心
算法论文8

国际头部高校联名发布 Agentic AI 的真正进化论

目前从‘LLM’向‘Agentic AI’跃迁,Agent实操能力不足。论文《Adaptation of Agentic AI》梳理领域情况,提出2x2象限框架,介绍优化Agent及工具的方法,还提及局限和未来方向并给出战术建议。

深度学习自然语言处理
推荐文章8

AI时代的设计:审美是唯一护城河!

文章指出AI时代设计门槛从会用软件转向有审美。介绍设计门槛转变原因、审美重要性,给出培养审美方法,推荐相关工具,为不会设计的人提供建议,强调审美是AI时代设计唯一护城河。

花叔
开源动态8

国产模型新盛况!王座易主:Kimi K2 Thinking开源超闭源

月之暗面开源 Kimi K2 Thinking 模型,多方面性能超 GPT - 5 等闭源模型。它擅长多轮调用工具和持续思考,在多项基准测试达 SOTA 水平,成本低且授权宽松,引发全网讨论。

机器之心
推荐文章7

证书透明度如何重塑互联网信任

文章探讨引入证书透明度(CT)的原因、工作原理及对数字信任的意义,揭示CA机构信任危机,介绍CT架构和实践工具,还展望其未来创新,如Static Sunlight API、委托凭据等。

InfoQ