「代码能力评测」共找到 4860 篇相关文章
先验+后验加持,大模型能否 hold 住推理预测的现实「溢出」?
多数大模型评估基准依赖固定数据集,难测真实推理实力。字节跳动等推出的 FutureX 动态评测基准,将重点移至动态预测能力。实验显示不同模型在不同任务表现有别,大模型在现实场景运用仍待优化。
卷疯了!这个清华系Agent框架开源后迅速斩获1.9k stars,还要“消灭”Prompt?
随着大模型能力突破,Agent 从概念走向应用。清华系 Agent 框架 Cooragent 开源获 1.9k stars。其创始人王政认为 Agent 框架要适应多样需求,解决泛化与精确性平衡等痛点,还分享了对 MCP、框架融合等看法。
刚刚,DeepSeek V4 Pro正式版发布!
周三晚间,DeepSeek 突然发布 V4 Pro 大语言模型正式版,命名为 DeepSeek - V4 - Pro - 0813,官方未调升 API 使用价格。有用户称调用的 V4 Pro 思维链风格有变,跑分显示其 Agent 评测表现可媲美顶级模型,还撞车了马斯克的 Grok 4.6。
神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光
神秘具身团队放出一连串Demo视频,其内部代号“MVP”的模型让机器人似人般思考决策。视频展示机器人在不同场景下的表现,如躲避推搡、做家务、机器人协作、高效收纳等,体现对物理规则和人类习惯的理解与自进化能力。
从一个公众号智能体说起:好用的Agent,究竟需要什么?
文章从公众号智能体切入,探讨好用的 Agent 所需条件。介绍腾讯云智能体开发平台 3.0,其有知识处理进化等能力;还提及 Agent 在酒店、营销等场景应用,强调可靠工程与用户触达对实现其价值的重要性。
AI Infra进入自进化时代!清华团队用「AI优化AI」造就国产万亿Token工厂
AI自主优化RSI成新焦点,被视为通往AGI的关键路径。硅谷为此沸腾,中国也不落后。清昴智能由清华团队创立,率先打造自进化算力底座,还基于国产算力打造万亿Token工厂,目标是让优化成为持续运行的基础能力。
9.7K Star 把 AI 编码的 token 消耗砍了 16 倍
当前AI编码工具默认读取整个项目文件,token消耗高。code-review-graph项目用Tree-sitter解析代码库成图,追踪改动“爆炸半径”,平均省8.2倍token,技术轻量,还能做社区检测。它揭示AI编码瓶颈在信息输入质量。
Seedance 2.0刷屏后,字节还有个硬核模型——3个复杂任务实测Seed 2.0
作者作为AI编程工具深度用户,没追热门的Seedance 2.0,而是实测同期发布的豆包大模型Seed 2.0。设计3个日常复杂任务,在TRAE接入其Pro版测试,展现出强大的自主纠错和多任务处理能力,也指出了不足。
PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃
快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。
杭州闯出40亿AI医疗IPO!阿里CEO多轮投资
杭州AI陪诊公司微脉准备赴港IPO,其创始人裘加林经验丰富。微脉依托自研CareAI平台,以与公立医院合作为核心开展全病程管理服务,业务增长可观,虽仍亏损但在收窄,此次募资用于AI能力提升和业务扩张。