代码评估」共找到 2297 篇相关文章

开源动态8

一键式训练端到端Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的端到端RL后训练框架,将环境与训练解耦,用Qwen3基座调用MCP工具集,可低代码训练端到端Agent模型。它极致易用、训练高效,还支持一键式训练,未来会更易用高效。

深度学习自然语言处理
产品应用8

Claude Opus 4.7炸场,6美元造《我的世界》,临门AGI前强调安全,打工人却更慌了

Anthropic 发布‘目前最强 Opus 模型’Claude Opus 4.7,能力跃升,在多榜单夺冠。写代码、看图表等能力提升,也有网页搜索等能力下降。还展现出游戏开发实力,同步上线Claude Code新功能,加强安全防护。

鲸选AI
7

苹果一口咬死AI不会思考!OpenAI前高管直接开怼:AGI已来,别再酸了

苹果论文《思考的错觉》挑战AI推理能力基本假设,引发争议。OpenAI前研究主管则称AGI时代已近。多项研究测试推理模型,指出其有进步也有瓶颈,未来或需换思路,评估方式也待完善。

新智元
新闻资讯7

这些关于研发提效的深度实践分享,值得每一位开发者关注 | AICon

6月27 - 28日AICon北京站上,多位大厂技术大牛将分享“AI赋能研发提效”经验。如丁宇介绍AI编程范式革新,张乐分享腾讯代码智能化实践,还有同程、百度、网易游戏相关人员分享研发提效经验。

AI前线
算法论文8

2026论文解读,ASAHI:自适应切片助力小目标检测,速度提升25%、精度创新高

高分辨率航空图像小目标检测难,传统检测器表现差。2026年4月都灵理工大学团队提出ASAHI,用自适应切片框架,在VisDrone2019上mAP50达56.8%,推理速度比SAHI提升20 - 25%,还介绍了实战代码等。

机器学习AI算法工程
算法论文8

你敢把「龙虾」放在手机上跑吗?手机 Agent 离落地还差一道「隐私关」

港中深联合腾讯混元研究揭示,手机 Agent 落地关键不在成功率,而在隐私边界。研究设计隐私交互协议,构建模拟 App 记录过程,将常见越界行为归类检查,评估多个模型发现诸多隐私问题。

AI科技评论
产品应用7

从衣服到饰品:OmniTry 实现珠宝、包袋等多类可穿戴物品的虚拟试穿

Kunbyte提出OmniTry,将VTON从服装扩展到任意可穿戴物品,采用无掩码设定。它经两阶段处理流程训练,在12种常见物品类别评估中表现优,有扩展潜力,但也存在训练数据类别限制等局限。

带你学AI
新闻资讯8

AI也能当情感大师?腾讯发布最新AI社交智能榜单,最新版GPT-4o拿下第一

腾讯混元AI数字人团队打造SAGE自动化评估框架,可评价AI“共情力”与能否成“知心伴侣”。研究团队用其对18个主流模型测评,GPT - 4o表现最佳,还通过多实验分析模型特性。

量子位
开源动态7

DeepSeek-R1今天一次「小更新」,颠覆了大模型格局,网友:尽快放R2

昨晚,DeepSeek官方宣布其R1推理模型升级到最新版本(0528),并公开模型及权重。该版本参数量高达6850亿,采用MIT许可证,性能提升明显,在多个基准测试中成绩优异,网友实测代码能力也大幅提升,但仍存在过度思考问题。

机器之心
算法论文8

能效翻5倍!他们复刻人脑双记忆通路,造出能长效记住上下文的类脑AI芯片

帝国理工学院博士后孙鹏飞和苏黎世联邦理工博士后苏哲及合作者,受大脑皮层机制启发,打造“双重记忆路径”类脑网络及配套芯片,处理语音识别任务时能效比此前优方案高5倍。相关论文发表在《自然·机器智能》且代码、设计全开源。

DeepTech深科技