← 返回归档

日报


新出现

GitHub Copilot 集成 Kimi K2.7 Code 模型

Kimi K2.7 Code 模型正式 GA 并集成进 GitHub Copilot,支持 Azure 托管与 open-weight 选项,Pro+/Max 计划用户可直接选择

开发者可在 VS Code 等 IDE 中零改动替换模型调用,直接在 AI 工程项目中接入并优化推理流程

  1. Kimi K2.7 Code is generally available in GitHub Copilot Hacker News #6
新出现

GitHub Copilot 优化 token 效率与缓存机制

GitHub Copilot 在 VS Code 中通过 prompt_cache_retention 设置提升缓存命中率 919%,用户 token 用量中位数下降 8.97%-18.32%

开发者可直接在 AI 工程项目中复现该 token 效率优化,显著降低成本与延迟

  1. Improving token efficiency for GitHub Copilot in VS Code Lobsters #9
新出现

OpenFeature 标准化 feature flagging API

OpenFeature 作为 CNCF 孵化项目提供 vendor-agnostic API 实现 feature flagging,One SDK 支持任意 backend 与工具,可无缝切换或多方案整合

开发者可迁移该标准化 API 到 AI 系统与工程项目,避免代码级锁定并支持多工具集成

  1. OpenFeature - Standardizing Feature Flagging for Everyone Lobsters #10
新出现

CursorBench 3.1 发布多模型代码任务基准

CursorBench 3.1 发布,按真实 Cursor 会话模糊多文件任务评分 36 个模型,Fable 5 Max 72.9% 领先

开发者可直接迁移该工程评估基准到自身 coding agent eval pipeline,避免空洞洞见

  1. CursorBench 3.1 Hacker News #4
新出现

Senior SWE-Bench 开源基准评估 AI 代理

Senior SWE-Bench 开源基准发布,包含自然语言任务、运行时调试要求和代码质量评分,leaderboard 显示 frontier model 在 senior 任务 solve rate 最高仅 24%

开发者可迁移任务模板、验证 agent 和 taste scoring 机制到自身 coding agent eval pipeline,更新对当前 agent 工程能力的判断

  1. Senior SWE-Bench: open-source benchmark that assesses agents as senior engineers Hacker News #8
新出现

METR 试验显示开发者对 AI 速度感知与实际表现存在偏差

METR 随机对照试验显示资深开发者用 AI 后自感快 20% 但实测慢 19%,并汇总多项行业数据讨论 AI 对熟悉代码库工作的影响

开发者可据此调整团队 AI 采用时的实际交付度量标准,而非依赖主观速度感觉

  1. The gauge broke: devs felt 20% faster with AI, measured 19% slower Hacker News #2