评估工程」共找到 1392 篇相关文章

推荐文章8

一年成爆款,狂斩 49.1k Star、200 万下载:Cline 不是开源 Cursor,却更胜一筹?!

AI编程助手看似热门,实则多数亏本运营。Cline选择开源,允许用户自由组合LLM编程,个人免费,企业服务收费。它一年成明星产品,获49.1k Star、近200万下载,其创始人分享了产品理念、发展等多方面思考。

InfoQ
新闻资讯7

马斯克:研究者不存在了,只有工程师;LeCun:大错特错

马斯克宣称xAI不再区分‘研究员’和‘工程师’,只有工程师,这一言论引发争议。支持者如工程师David Brown等认可其观点,反对者则从多方面反驳,图灵奖得主Yann LeCun还详细阐述研究与工程差异。

机器之心
新闻资讯7

解道奥赛题成本5000美元?陶哲轩警告,AI下一步要规模化的「更便宜」

谷歌新一代 Gemini 进阶版在 IMO 竞赛达金牌水平,华人数学家陶哲轩对此关注且担忧。他认为评估 AI 表现应谨慎,AI 发展需从定性转向定量,要‘降本增效’,未来标准化评测很重要。

机器之心
产品应用7

好奇心之旅:Cursor代码库索引机制的学习笔记

作者作为高德信息工程团队AI先锋队一员,日常用Cursor开发,因好奇其代码库索引机制展开探索。介绍了Cursor索引工作流程、隐私安全等,还研究Merkle树、turbopuffer向量库及开源方案Continue。

阿里云开发者
新闻资讯8

不止AlphaFold,「药界ChatGPT」横空出世!华人女投资人深度揭秘

AI初创Chai Discovery宣布分子设计模型Chai-2重构药物设计逻辑,将抗体设计成功率从0.1%提升到16%,实现零样本设计。其联创认为这是范式革命,未来药神或成提示词工程师。

新智元
算法论文7

ICML'25 | 告别手动SFT!一句话得到你的专属大模型LoRA

传统微调方法开销大、部署难,Text-to-LoRA (T2L) 框架应运而生。它基于自然语言指令对 Transformer 模型即时适配,有三种架构变体,采用两种训练方法,实验显示其在多维度表现有效。

PaperAgent
新闻资讯7

Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光

苹果一篇质疑大模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力的方法。

新智元
推荐文章7

Anthropic的多智能体,真的有必要吗?

作者曾质疑多智能体系统,看了Anthropic对「Claude Research」的说明后有了改观。介绍了多智能体系统定义、性能提升、代价,还阐述构建方法、评估方式,公开三个核心提示词及协作模式。

AGI Hunt
算法论文8

知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳

东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。

量子位
开源动态8

统一20+多智能体方法,MASLab震撼发布

由十机构联合推出的 MASLab,带来大模型多智能体系统代码库,统一 20+主流 MAS 方法。有方法全、评估准、结构清晰特性,经大量实验刻画性能图谱,还提出新方法,且发起开源社区。

机器之心