评估工具」共找到 2519 篇相关文章

推荐文章8

Vibe Coding 方法论:不会编程的人如何用 AI 写出能跑的代码

文章介绍 Vibe Coding 方法论,即便不会编程,也能用 AI 写出能跑的代码。核心是把需求说清楚,还可小步迭代开发,Claude 这类会主动询问的工具更适用,同时要明确其适用场景。

宝玉AI
算法论文8

邱锡鹏老师团队发布VehicleWorld:让智能汽车真“智能”

邱锡鹏老师团队发布论文,构建高度仿真的智能座舱虚拟环境VehicleWorld,并提出基于状态的函数调用(SFC)方法。实验显示,SFC大幅提升任务执行准确率和效率,还构建了Vehicle Benchmark进行评估

深度学习自然语言处理
新闻资讯7

清华辍学、斯坦福睡地板,华人小哥用AI社交挑战Meta,融资数千万美元

来自中国的小哥Brandon Chen打造AI原生即时通讯工具Intent,已获数千万美元融资。它结合微信聊天与大模型自动执行功能,如处理图片、规划旅行、生成购物清单等,带来全新聊天体验。

机器之心
新闻资讯3

马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?

Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。

AI寒武纪
算法论文8

人类创造力的核心机制,AI已经开始掌握了 | 北大CogSci 2025(Oral)

北大团队论文揭示AI开始掌握人类创造力核心机制,提出IEI框架量化评估AI组合创造力。研究发现GPT - 4等在创意理解超普通人,框架优化可提升AI创意输出质量,论文被CogSci 2025收录。

量子位
产品应用7

Claude Code 强大的秘密究竟是什么?

Claude Code 强大源于其强大模型基础、丰富实用的内置工具、不压缩上下文信息及无 IDE 包袱等优势。相比之下,OpenAI 的 Codex 因模型能力、强化训练不足等落后,Anthropic 还靠亏本推广积累数据。

宝玉AI
新闻资讯8

全球最强编码模型 Claude 4 震撼发布:自主编码7小时、给出一句指令30秒内搞定任务,丝滑无Bug

Anthropic 首届开发者大会发布 Claude 4 系列,含 Opus 4 和 Sonnet 4 两型号,编码、推理能力强。Opus 4 处理长任务出色,是最佳编码模型;Sonnet 4 经济高效,被 GitHub 等采用。Claude Code 工具也正式发布。

AI前线
产品应用8

Google | 发布革命性编码智能体:AlphaEvolve,突破数学极限!

DeepMind 发布由 LLMs 驱动的进化编码智能体 AlphaEvolve,能演化代码库用于算法发现和优化。它结合 LLM 创造力与自动化评估,减少幻觉,在谷歌计算生态、数学算法等多领域有巨大应用潜力。

AINLPer
新闻资讯8

刚刚,马斯克Grok 4.1低调发布!通用能力碾压其他一切模型

xAI 低调发布 Grok 4.1 并向所有用户开放,可多平台使用。该模型在真实世界可用性上显著提升,尤其在创造力等方面出色。它在多项评估中表现优异,通用能力领先,情感智能、创意写作佳,还降低了事实幻觉。

机器之心
开源动态8

多模态长文本理解测评首发:46款模型无一攻克128K难关

香港科大等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。

量子位