评估工具」共找到 2519 篇相关文章

产品应用7

The Batch:831 | 机器翻译正在实践中发挥作用

人工智能为语言学习应用巨头 Duolingo 带来生产力提升,借助生成式 AI 构建 148 门课程,总量翻倍。其 AI 辅助课程构建法能快速转化多语种版本,还在评估多模型,不过此举也引发批评。

DeeplearningAI
新闻资讯7

哈佛新研究:过度使用AI会“烧脑”,14%用户出现认知过载

哈佛研究证实过度使用AI会“烧脑”,是认知降维打击下的压力过载。调查显示14%用户出现认知过载症状,AI工具过多还会增加认知切换成本。研究指出企业需重新设计工作方式,实现人机平衡。

量子位
推荐文章8

第三个软件黄金时代来了!软件工程宗师、70 岁 UML 之父发声:AI 自动化被严重夸大,Dario Amodei 又越界了

软件工程宗师、UML 之父 Grady Booch 在播客分享对计算领域三次‘黄金时代’理解,直言 Anthropic CEO Dario Amodei‘软件工程将 12 个月内自动化’判断错误,强调工具虽变但软件工程难题未消失。

InfoQ
开源动态7

跨平台智能媒体处理与创作工具

pyMediaTools 是基于 PySide6 的跨平台桌面应用,集成媒体批处理和 AI 音视频创作工具。利用 FFmpeg、ElevenLabs 和 Groq API,有格式转换、语音合成等功能,还介绍了安装、配置、打包方法。

GitHubStore
算法论文8

首个英文原生「弱智吧」!逻辑谬误数据集与生成框架来了 | AAAI'26

研究发现大模型判断逻辑谬误易误报正常句子,但分类能力较强。研究人员构建英文逻辑谬误基准SMARTYPAT - BENCH,开发生成框架SMARTYPAT,为大模型逻辑评估提供新思路,可用于多领域。

新智元
产品应用8

30 小时不眠不休写代码,Claude 4.5 的三个“最佳”

Anthropic发布Claude Sonnet 4.5,宣称其为“世界上最好的编码模型”等。它在测试中表现出色,能力全面提升,价格实惠,开发者测试效果佳。还注重安全,升级开发工具和生态系统。

AIGC开放社区
开源动态8

6K+ star神器!Docker也能跑桌面了,安全隔离还能硬件加速,太绝了!

文章介绍开源工具`x11docker`,它专为 Docker、podman 等设计,能让图形应用在容器正常运行,增强隔离性、避免安全隐患。该项目获 6K+ Star,功能丰富,安装使用简单。

开源先锋
新闻资讯7

创始人“背刺”员工获财富自由,Devin 接盘火速兑现员工期权,华人 CEO 暗讽:做个人吧!

当地时间 7 月 14 日,Cognition 宣布收购 Windsurf。此前 Windsurf 收购案波折不断,创始人带部分人去谷歌,遭网友吐槽“背刺”员工。Devin 接盘后保障员工权益,还引发对 AI 编程工具竞争的讨论。

InfoQ
新闻资讯7

研究表明,开源能推动AI创新和经济增长

Siliconangle消息,Linux基金会新研究显示开源对全球经济贡献达9万亿美元。其首席经济学家Frank Nagle指出,AI加入使开源价值评估方式改变,计算开源AI价值复杂,参与开源项目能增加经济价值。

AIGC开放社区
算法论文7

正确答案 ≠ 正确推理,CoT 或成大模型推理能力停滞的「罪魁祸首」?

研究指出当前大模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年大模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。

AI科技评论