「代码评估数据集」共找到 4416 篇相关文章
详解Github 35K+项目:打通200+数据源,构建企业级AI的数据统一入口,支持MCP【下篇】
本文继续介绍MindsDB这款开源AI数据引擎,阐述知识库与混合检索应用,如创建向量索引、语义检索、多源混合检索等;还提及RAG与数据智能体,包括构建RAG管道和配置Data Agent;最后给出应用建议,称其适合复杂企业环境。
AI首胜人类博士,顶会论文秒变代码!港大90后开源刷爆8k星
香港大学黄超团队开源的DeepCode,能分析论文、生成可运行代码。在四大基准测试中全面领先,首超人类专家,还优于现有AI Coding。它有三大核心能力,采用三阶段框架实现代码自动转换。
OceanBase全面拥抱AI新进展:OB Cloud支持十亿级多类型向量数据,数十家企业实现AI应用落地
大模型热潮下,企业面临AI落地难题。OceanBase的OB Cloud支持十亿级多类型向量数据,已有数十家企业实现AI应用落地。它具备多云原生、AI能力优势,提供一体化架构和多模向量一体化,还降低了AI应用门槛。
深度机智和他们的另一条路:用人类第一视角数据训练基座模型|甲子光年
3月27日,深度机智联合推出具身通用智能基座模型系统PhysBrain 1.0,引入人类第一视角数据,解决传统模型问题。其创始人陈凯等坚持用此数据构建模型,突破传统,引领行业新方向,且中国在具身智能领域或借此建立自主技术体系。
0行人类代码!OpenAI内部绝密实验曝光:3人团队5个月砸出百万行级产品
OpenAI工程团队进行内部实验,构建并发布零人类代码的内部软件产品,代码全由Codex智能体编写。团队分享开发经验,如重新定义工程师角色、让应用对智能体可见等,还面临一些未知挑战。
不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案
作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。
银河通用LDA定义全域数据利用范式,跨本体世界动作大模型开启具身GPT-2时刻
当下具身智能赛道两大流派各有短板,银河通用推出跨本体「隐式世界 - 动作基础模型」LDA - 1B,走自研WAM路线,成果已开源。它打破数据割裂难题,解锁具身智能「GPT - 2时刻」,在多方面展现优势。
机器学习先驱Daphne Koller警告:AI制药不是魔法棒,下一代药物发现还缺1000倍数据
知名学者 Daphne Koller 在 a16z News 发文指出,AI 制药当前最受关注的进展多在分子设计,但新药研发难题在上游,疾病机制的靶点选择错误导致大量临床试验失败,且当前数据距构建完整生物学因果模型差约 1000 倍。
对话蚂蚁灵波首席科学家沈宇军:2万小时真机数据,用“慢功夫”做具身智能|甲子光年
蚂蚁灵波首席科学家沈宇军接受专访,称具身智能处于‘GPT - 1时刻’。团队选‘慢’路,积累2万小时真机数据,发布四个具身智能模型并开源。介绍模型架构、优势、问题及未来计划,还谈了开源考量等内容。
首个基于MCP 的 RAG 框架:UltraRAG 2.0用几十行代码实现高性能RAG, 拒绝冗长工程实现
检索增强生成系统(RAG)复杂度提升,工程实现成本高。清华大学等联合推出首个基于MCP架构的UltraRAG 2.0,组件化封装、调用扩展灵活,低代码实现高性能,可用于科研和行业应用。