评估驱动开发」共找到 2708 篇相关文章

新闻资讯8

最强编码模型Claude 4来了!Mcp集成无需Client,扩展提示缓存增强Agent长上下文保持能力

Anthropic 昨日推出新一代 Claude 模型,包括 Claude Opus 4 和 Claude Sonnet 4,在编码、高级推理和 AI Agent 方面树立新标准,有卓越编码能力、显著提升的 Agent 能力、全新 API 功能,Claude Code 也全面上市。

AI工程化
新闻资讯8

英伟达让机器人「做梦学习」,靠梦境实现真·从0泛化

英伟达推出DreamGen项目,让机器人‘做梦学习’。它利用视频世界模型生成神经轨迹,仅少量现实视频就能让机器人学会新任务,实现从0泛化,还将助力GR00T - Dreams发展。

量子位
推荐文章8

对谈openai首席产品,AI时代的产品思路。

知名播客主理人Lenny对OpenAI CPO Kevin Weil进行访谈,分享了OpenAI内部的产品哲学,包括Model Maximalism、Iterative Deployment、Evals等方法论,还谈及AI技术演进、未来机遇等思考,鼓励培养核心能力应对AI变革。

探索AGI
产品应用7

CSD7Z020 + CSD9361:从射频到基带,构建完整SDR数据通路

成都华微以CSD7Z020异构SoC搭配CSD9361宽带射频收发器搭建SDR硬件平台,打通从射频到应用层的数据通路,有灵活可编程、高集成度等优势,适用于多种场景。

芯师爷
新闻资讯7

一种用于管理 AI 变革步伐的演进式架构模式

Cloudflare推出基于QuePaxa共识算法的Meerkat服务,可无领导者写入并保持强一致性,提高网络可用性。它预计将是QuePaxa全球首次生产部署,但存在局限性,如大量往返通信。

InfoQ
开源动态7

缓存命中率99.93%!DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star

DeepSeek官方版Harness未出,民间开源编程Agent「Pi」先火。它适配DeepSeek,让其缓存不命中率低至0.03%,调用成本大降。Composio测试显示Pi完成任务平均成本最低。同时,DeepSeek正组建团队做官方Harness。

量子位
推荐文章8

Lilian Weng:Harness才是模型自我迭代的现实起点和关键,而不是直接重写权重

Thinking Machines Lab联合创始人Lilian Weng发文指出,实现AI递归式自我改进(RSI),设计围绕模型的执行系统“Harness”才是现实起点。文中详述Harness设计模式、优化路径,也指出自我改进面临的瓶颈。

AI寒武纪
开源动态7

Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小

Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。

InfoQ
开源动态7

离谱!我以为 OCR 还在一页页抠字,结果百度 1.2 万 Star Unlimited-OCR 直接把长文档一口气读完

百度开源的Unlimited - OCR项目目标是处理图片、长文档等资料,将其转化为Markdown等结构化结果。它提供多入口,解决传统OCR处理长文档的问题,有多种应用方向,但也有边界。

小华同学ai
新闻资讯7

旧手机除了放转转,还能放数据中心提供算力

Google和UC San Diego合作,将退役Pixel手机拆解成主板组成计算集群,跑教学科研任务。研究表明,旧手机算力仍有价值,可用于轻量任务,还能降低隐含碳,或催生新产业链。

DeepTech深科技