#Benchmark
GitHub 发布 ReviewBench:用 1 亿真实 PR 建立可复现的 AI 代码审查基准
AI代码审查最难的,已经不是“能不能找到问题”,而是“不同工具的分数到底能不能信”。
GitHub刚发布ReviewBench:用1.039亿个真实Pull Request刻画工作负载,再用2…
腾讯 WorkBuddy Bench 开源:260 道 Agent 评测任务 + 2 个自动化 Skill
腾讯 WorkBuddy 团队最新开源了 2 个 Agent Skill:wbbench-report-skills 和 wbbench-run-setup。
WorkBuddy Bench 是 WorkBuddy 产品工程实践的副产品&m…
Meta 发布全新大模型 Muse Spark:多模态是强项,编程是短板
今天凌晨,Meta 发布了全新的大模型 Muse Spark,已上线到 Meta 旗下的各类产品。
Meta Superintelligence Labs(MSL)负责人 Alexandr Wang 在推特上宣布了这个消息。他说,九个月前团…