「测试全流程」共找到 3925 篇相关文章
Jeff Dean:一年内 AI 将取代初级工程师,网友:“Altman 只会画饼,Jeff 说的话才致命”
谷歌传奇工程师 Jeff Dean 在访谈中预测,一年内将有具备‘初级工程师’能力的 AI 系统。他还谈到 AI 发展方向、智能体潜力、大模型格局等,也提及硬件重要性及 AI 在科研领域的影响。
大模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%
Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验大模型创造性推理能力。结果显示大模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。
我去,短短时间,狂揽27.4K星,Windows用户的春天,任务栏秒开Linux的「神器」来了,6的飞起
由 Cascadium 团队打造的 WSL Windows Toolbar Launcher,将 Linux 终端装进 Windows 任务栏。它有一触即发控制台、状态感知任务栏等功能,适用全栈开发、机器学习等场景,与同类项目相比优势明显。
Claude 4发布:最强AI编程模型+最强AI Agent基建!
Google I/O大会后一天,Anthropic凌晨发布Claude Sonnet 4和Claude Opus 4。Claude Opus 4是“世界上最好的编程模型”,Claude Sonnet 4适合日常编程。此次更新有四大核心改进,聚焦开发者。还介绍了工作模式、定价等。
一分钟做3D音符版“跳一跳”,Flowith成通用Agent新“必玩王者”丨TIP 003
Flowith作为较早出海的AI产品,以自由画布+通用Agent组合出圈。其Neo版本技术功能强,产品服务有亮点,如不限DeepResearch任务、以人为主的智能代理、回答速度快等,虽有不足但未来值得关注。
AI 写代码老出错?Code Rabbit 来给 Cursor 当“纠错教练”,边写边改。
Cursor的AI Agent写代码虽强但易出错,Code Rabbit可当“纠错教练”。它本用于审查GitHub PR和commit,现推出VS Code、Cursor等插件,能分析代码改动、提建议,与Cursor配合可减少bug。
北大校友、OpenAI前安全副总裁Lilian Weng关于模型的新思考:Why We Think
北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算研究进展,探讨激励模型思考方式,介绍思维链、并行采样、序列修订等策略,还提及强化学习、外部工具使用及未来研究方向。
突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更低,网友好评:响应快、不废话
当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1,含三款模型,性能比肩Claude 3.5且成本更低。开发者试用评价不错,但也指出不足。Windsurf称旨在提升软件开发速度,还介绍了测评、编辑器赋能等情况。
DiffMoE:动态Token选择助力扩散模型性能飞跃,快手&清华团队打造视觉生成新标杆!
清华大学和快手可灵团队推出DiffMoE,通过创新的动态token选择机制和全局token池设计,拓展了扩散模型的效率与性能边界。实验表明,DiffMoE在多方面超越现有模型,未来集成先进技术或有新增益。
支持中文!NotebookLM自动生成播客
Google宣布NotebookLM语言摘要功能支持50多种语言,包括中文,可将上传文档转成播客对话形式。以一篇AI进化论文为例展示效果,其音频和内容质量不错,学习输入立体,还能助力AI播客创作。