编程能力评估」共找到 4438 篇相关文章

推荐文章8

直播预约 | Evaluation论文分享@ICML&ACL2025

2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。

深度学习自然语言处理
新闻资讯8

Scaling没有墙!Anthropic CEO:AI实验室真相远超公众想象

Anthropic CEO Dario Amodei在摩根士丹利会议称Scaling Law未撞墙,2026年将激进加速。他用棋盘稻米寓言比喻,称当前处第40格,前39格增长只是前奏。还透露代码生成是AI能力爆发指标,Anthropic或在RSI取得进展,且重视人才文化。

新智元
新闻资讯7

突发!OpenAI新模型Astra吓瘫奥特曼:暂停训练两周,GPT-6训练一并冻结

OpenAI宣布暂停内部最强大模型强化学习,Astra模型暂停训练两周,GPT - 6也暂停。原因包括Hugging Face安全纰漏和Astra网络攻击能力越线。还采取物理隔离、严格监控、打击作弊等措施,或有营销意图。

AI寒武纪
产品应用7

Fable 5 刚被封杀,OpenRouter 用「多模型协作」搞出了「平替天团」

2026年6月14日,OpenRouter推出复合模型Fusion API,可复刻Claude Fable 5智力水平。它采用多模型协作,经DRACO测试效果出色,成本减半,但也有编程不实用、速度慢、数据合规存黑箱等问题,重塑了AI行业逻辑。

AI科技评论
新闻资讯7

Hinton预言失灵?掌握AI技能涨薪23%,比读硕士更赚钱

新智元报道,Hinton称AI会让贫富差距拉大,但掌握AI技能涨薪幅度超想象,比读硕士回报高。市场对AI科技岗需求创新高,企业愿为AI技能付高薪,实战能力比认证更重要。

新智元
新闻资讯7

DoorDash 如何打造了一款不完全依赖大型语言模型(LLM)的 AI 购物助手

DoorDash 分享对话式 AI 助手 Ask DoorDash 的架构,它借助 LLM、AI 代理等构建系统。测试显示其提升了结账转化率等指标,还构建自动评估框架改进质量衡量,架构分离协调与业务功能。

InfoQ
新闻资讯7

GLM-5.2真正的跨越:CritPt密闭物理数据集测试得分20.9%,打平Opus-4.8

GLM - 5.2在CritPt密闭物理数据集测试中表现亮眼,与Claude Opus 4.8得分并列,远超其他开源模型,还击败多款闭源模型,实现4.5倍代际飞跃,标志开源模型科学推理能力进步。

AI寒武纪
产品应用8

「OpenClaw之父点赞」终结百虾大战?一场升级版的AI原生革命上演

2026年科技圈“百虾大战”正酣,网易有道全量开源桌面Agent产品LobsterAI,获OpenClaw之父赞扬。有道还孵化多个Agent产品,重构底层逻辑,转变商业模式,深扎场景切片,探索“能力+订阅”范式。

新智元
产品应用7

Legora、Mercor 都在用,Reducto 能成为独立的 LLM 数据入口吗?

当前企业AI落地瓶颈在数据质量,Reducto聚焦数据准确性,以文档解析API提供Agentic OCR能力。它获多轮融资,估值达6亿美元,但面临多模态模型竞争及定价等问题,其未来走向待察。

海外独角兽
开源动态8

开源模型终于有了自己的 Opus 时刻

智谱深夜发布的新一代旗舰模型 GLM - 5,此前以匿名模型 Pony Alpha 被开发者热测。2026 年编程大模型风向转变,GLM - 5 参数提升,测试成绩优异,实测能完成复杂工程任务,适配国产算力平台。

AGI Hunt