跳到正文

#编码

今日 4 条
今天10月9日周五
  1. Simon Willison13

    ttok 0.4 发布

    CLI 工具 ttok 发布 0.4 版本。该版本修复了 Click 警告,更新了 CI 流程,并新增 --list-models 命令以列出可用模型。工具基于 OpenAI 的 tiktoken 库构建,支持通过 uvx 运行,例如使用 cat file.txt | uvx ttok 统计文件 token 数量。

10月8日周四
10月7日周三
  1. Simon Willison12

    软件博客写作的反模式

    Michael Lynch 指出软件博客写作的常见反模式,包括冗长引言、误判读者知识水平、过度依赖链接以及行文过于正式。他强调文章应独立于链接存在,并主张使用自然口语化的个人风格。随着开发者大量使用 AI 代写,博客内容趋于同质化,读者更渴望具有个性的写作。

  2. Hugging Face Blog83

    Nemotron 微调模型获 IOI 与 IMO 双金牌

    Hugging Face 发布 Nemotron 系列模型在 IOI 2026 和 IMO 2026 竞赛中获金牌的成绩。Nemotron-3-Ultra-CC 在 IOI 中得分 535.4/600,IMO 系统得分 30/42。官方开源了相关模型权重、训练数据集、推理代码及 NeMo-Skills 工具包。

    推荐理由:原文给出了 Nemotron 在 IOI 和 IMO 的金牌成绩及微调方法,读者可据此复现顶尖编程与数学推理能力。

  3. Latent Space97

    AI新闻:OpenAI发布722篇数学论文,Mistral推出Large 4模型

    OpenAI发布内部Navier-Stokes模型的722篇数学手稿,包含准黎曼猜想等成果,引发数学界重大反响。Mistral发布1T参数多模态模型Large 4,支持API并承诺开源。Google推出多模态嵌入模型EmbeddingGemma 2及图像模型Nano Banana 2.1。OpenAI发布决策API公测版,Anthropic扩展网络安全验证计划。

    推荐理由:原文梳理了OpenAI内部模型数学突破、Mistral新模型发布及多项工具更新,提供行业全景与关键争议点。

10月6日周二
  1. Mistral AI92

    Mistral 发布 Mistral Large 4 预览版

    Mistral 发布 Mistral Large 4 预览版,该模型拥有 520 亿活跃参数,在编码、Agent 工作流及多模态理解上表现领先。模型将于月底开源权重,目前可通过 Mistral Studio 试用 API。

    推荐理由:原文披露了万亿参数架构与欧洲算力底座,并给出安全与编码等维度的实测数据。

  2. AWS Machine Learning Blog68

    Amazon SageMaker 发布 aws-ai-ml 智能体技能

    Amazon SageMaker AI 发布 aws-ai-ml 智能体技能,支持通过 Model Context Protocol (MCP) 接入 Kiro、Claude Code 等编码智能体。该技能可自动为模型生成 SageMaker Python SDK v3 部署代码,提供基准测试、实例选型推荐及性能对比功能。

    推荐理由:通过 MCP 协议将 SageMaker 推理优化能力接入主流编码智能体,实现从自然语言到可执行部署代码的自动化闭环。

10月3日周六
10月2日周五
  1. GitHub Blog · AI & ML25

    GitHub 博客:AI 正在改变开发者工作,这里有三个需要加强的技能

    GitHub 博客指出 AI 正在改变开发者工作,建议开发者加强三项核心技能。首先,学会指导 AI 智能体而非仅使用它,通过定义问题和评估输出来协调多个 Agent。其次,不要盲目信任 AI 的首个答案,应利用第二个模型或自身经验进行审查。最后,利用 AI 节省的实施时间解决更宏观的问题,如理解客户需求、评估权衡并做出技术决策。

  2. NVIDIA Blog70

    NVIDIA 博客:GPT-6 Astra Ultrafast 模式在 Blackwell GPU 上实现 8 倍加速

    OpenAI 推出 GPT-6 Astra Ultrafast 模式,在 NVIDIA Blackwell GPU 上通过推理优化实现比标准模式快 8 倍的 token 生成速度。该模式已开放 API 访问,旨在缩短编码 Agent 的编辑测试循环及工具调用响应时间。

    推荐理由:GPT-6 Astra Ultrafast 模式提供 8 倍加速,直接优化了 Agent 编码与工具调用的响应延迟。

10月1日周四
  1. Ars Technica · AI83

    Google 发布 Gemini 4 Argon 模型,API 定价与百万级输出已公布

    Google 发布 Gemini 4 Argon 模型,API 定价为输入 2 美元/百万 token、输出 10 美元/百万 token,支持 100 万 token 输出。该模型在 DeepSWE v1.1 基准测试中得分 77.9%,已用于内部代码迁移并节省大量内存。

    推荐理由:Argon 提供百万级输出与工程基准领先数据,可评估其在长程任务与代码重构中的实际价值。

  2. Google DeepMind90

    Google 发布 Gemini 4 Argon 模型,输出上限扩至 100 万 token

    Google 发布前沿模型 Gemini 4 Argon,将输出 token 上限扩至 100 万,在 DeepSWE、Vals Index 等评测中领先。该模型定价为输入 2 美元/百万 token,正通过 Fairwind 计划向受信任的网络安全防御者开放。

    推荐理由:Argon 将输出上限扩至 100 万 token 并强化安全防御,为复杂长程推理与代码工作流提供了新基准。

9月29日周二
  1. Simon Willison78

    OpenAI DevDay 2026 发布 Dots 智能体与 GPT-6.1 Sol

    OpenAI 在 DevDay 2026 上发布个人智能体 Dots 及协作空间 ChatGPT Space,并推出 GPT-6.1 Sol 模型与 Ultrafast 推理服务。同时发布了 Codex Security Cloud、Sign in with ChatGPT 及 OpenAI Marketplace 等开发者工具与平台功能。

    推荐理由:原文记录了OpenAI发布Dots智能体、GPT-6.1 Sol及多项开发者工具,可据此评估其工作流整合与工程能力变化。

  2. Simon Willison82

    Claude Sonnet 5.5 发布,性能提升并取代旧版成为免费层模型

    Anthropic 发布 Claude Sonnet 5.5,宣称速度提升 30% 以上且成本降低,在多项基准测试中表现优于 Sonnet 5。该模型现已成为 claude.ai 免费层默认模型,实测编码能力接近 Opus 5.5。

    推荐理由:原文实测了模型在编码和推理上的表现,并指出其已取代旧版成为免费层模型,直接影响普通用户的可用能力。

9月24日周四
  1. GitHub Blog · AI & ML65

    GitHub Copilot App 重构巨型 Pull Request 渲染性能

    GitHub Copilot App 重构了巨型 Pull Request 的渲染视图,通过分离代码与评论的双几何架构及异步测量机制,实现了百万行代码与数百条评论的流畅交互。

    推荐理由:通过双几何架构与异步测量机制,解决了百万行级PR渲染卡顿问题,为处理超大规模代码审查提供了工程参考。

9月21日周一
  1. Hugging Face Blog67

    Hugging Face tokenizers v1 发布,性能提升数倍至数十倍

    Hugging Face 发布 tokenizers v1 版本,通过位流拆分、词缓存和内存复用等底层重构,使编码速度较 v0.23 提升 3 到 30 倍。该版本保持 API 和输出完全一致,目前已在 crates.io 提供预发布版本。

    推荐理由:通过底层架构重构实现数倍至数十倍的性能提升,为大规模数据处理提供了可迁移的工程优化方案。

9月18日周五
  1. GitHub Blog · AI & ML30

    GitHub Podcast 解析 AI 开发五大争议观点

    GitHub Podcast 深入剖析 AI 开发中的五个争议性观点,指出开发者仍需阅读并负责 AI 生成的代码,AI 工具的使用关键在于判断力而非盲目依赖。文章澄清 Skills 与 MCP 解决不同问题,二者可结合使用;RAG 并未过时,而是与 Agent、Skills 共同构成工作流;代码可维护性比微调模型更重要。

9月9日周三
  1. Mistral AI38

    Mistral 利用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++

    Mistral 利用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++,完成物理密集型储层模拟器的现代化改造。项目通过构建数值一致性测试框架验证迁移结果,并使用 Vibe CLI 和 Mistral OCR 生成文档。最终采用人类主导的 coder、tester 和 reviewer 智能体工作流,在保留代码质量的同时解决智能体卡死问题。

9月3日周四
  1. Hugging Face Blog80

    Hugging Face 发布 funes 为编码 Agent 提供本地记忆层

    Hugging Face 发布开源工具 funes,将 Claude Code、Codex 等编码 Agent 的会话日志转化为可检索的记忆层。它支持本地增量索引与跨机器共享,通过向量与 BM25 混合检索实现 Agent 间的记忆继承,并提供了 ask 命令用于独立查询。

    推荐理由:提供了将编码 Agent 会话日志转化为可检索记忆层的本地工具,支持跨机器和跨 Agent 共享。

  2. Hugging Face Blog75

    使用TRL和OpenEnv复现语言模型水彩画训练

    本文详细记录了使用TRL和OpenEnv在Hugging Face上复现语言模型水彩画训练的全过程。作者开源了包含参考池、RL环境、评分模型及训练脚本的完整流水线,并对比了三种奖励权重组合的训练效果,指出通过构建高质量参考池可实现对模型审美风格的精准控制。

    推荐理由:提供了基于TRL和OpenEnv复现RL绘画的完整代码与基础设施搭建细节,可直接迁移用于其他审美对齐任务。

  3. Google DeepMind78

    Google DeepMind 推出 Fairwind 计划,提供 Gemini 3.8 Flash Cyber 自主漏洞修复能力

    Google DeepMind 推出 Fairwind 计划,向政府和可信合作伙伴开放 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,实现自主发现并修复代码漏洞。该方案旨在以较低成本在安全云环境中生成可部署补丁,缩短从漏洞检测到修复的时间。

    推荐理由:结合 Gemini 3.8 Flash Cyber 与 CodeMender 提供自主漏洞修复能力,为政企客户提供了规模化防御的可选方案。

  4. Google DeepMind87

    Google DeepMind 发布 Gemini 3.8 Flash 及网络安全版

    Google DeepMind 发布 Gemini 3.8 Flash 及 Gemini 3.8 Flash Cyber,在保持 3.7 Flash 同等低成本($0.75/$3.75 per million tokens)的同时,显著提升了编码、推理及网络安全能力。

    推荐理由:在保持3.7 Flash同等低成本的同时,显著提升了编码、推理及网络安全能力,为开发者提供了高性价比的升级选择。

8月17日周一
8月14日周五
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.7 Flash 模型

    Google DeepMind 发布 Gemini 3.7 Flash,在编码、智能体和复杂文档处理任务上显著优于 3.6 Flash,并提供半价定价。该模型已用于 Gemini Spark,并更新了 CBRN 和网络安全方面的安全护栏。

    推荐理由:在编码和智能体任务上性能显著提升,并提供半价定价,有助于开发者低成本扩展生产级应用。

7月31日周五
  1. Google Research76

    Google Research发布Science One Framework:基于Chain-of-Evidence的可验证自主科研框架

    Google Research发布Science One Framework及Chain-of-Evidence (CoE) 框架,旨在解决AI自主科研中的可验证性问题。该框架通过构建完整的证据链,实现了零虚假引用和完全可复现的实验分数,同时在MLE-Bench和Parameter-Golf等前沿基准上达到SOTA性能。

    推荐理由:提出Chain-of-Evidence框架与CoE Audit,通过强制证据链解决AI科研幻觉,在保持前沿性能的同时实现零虚假引用。

7月26日周日
7月17日周五
  1. Google DeepMind78

    Google 发布 Gemini 3.5 Flash Cyber 安全模型

    Google 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调的轻量级网络安全模型,旨在快速发现、验证和修复漏洞。该模型通过 CodeMender 向政府和受信任合作伙伴有限开放,在内部基准测试中表现优于主版本 Flash 模型。

    推荐理由:模型针对代码安全微调,在内部基准中超越主版本,通过CodeMender限流发布,为安全团队提供低成本高效方案。

7月2日周四
  1. Mistral AI72

    Mistral 发布 Leanstral 1.5 形式化推理模型

    Mistral 发布 Leanstral 1.5,一款 6B 激活参数的开源形式化推理模型,在 miniF2F、PutnamBench 和 FATE-H/X 基准上刷新 SOTA。该模型通过长上下文推理在代码验证中发现多个隐藏 Bug,并提供免费 API 与 Hugging Face 权重。

    推荐理由:在形式化验证基准上刷新SOTA且成本极低,展示了长上下文推理在代码验证中的实际效用。

7月1日周三
  1. Hugging Face Blog66

    IBM发布ScarfBench基准测试AI智能体企业Java框架迁移能力

    IBM Research发布ScarfBench基准,评估AI智能体在企业Java框架迁移中的表现。测试显示,尽管编译成功率较高,但最强智能体的行为保持成功率不足10%。研究指出,迁移难点在于配置与依赖管理,且智能体对自身完成度存在过度自信。

    推荐理由:通过构建真实企业级Java迁移场景,揭示AI智能体在行为保持上的局限,提供可复现的评估基准。

6月1日周一
  1. Hugging Face Blog72

    JetBrains 发布 Mellum2 12B MoE 模型

    JetBrains 发布 Mellum2,一个 12B 参数的 MoE 模型,每 token 仅激活 2.5B 参数,推理速度比同类模型快 2 倍以上。该模型开源并支持 Apache 2.0 协议,适用于路由、RAG、子智能体和私有部署。

    推荐理由:原文给出了模型架构和性能数据,读者可以据此评估它在多模型系统中的路由和编排价值。

  2. Hugging Face Blog40

    超越大语言模型:可扩展企业 AI 采用取决于智能体逻辑

    IBM 通过引入程序分析和知识图谱等智能体逻辑,显著提升了企业级 AI 智能体的性能与成本效益。在遗留代码理解场景中,Mistral Medium 250B 模型配合该逻辑实现约 30 倍更低的 Token 消耗;在测试生成方面,Devstral 24B 模型结合 Aster 库使代码覆盖率提升 20%-45%,Token 消耗降低多达 15 倍。

5月29日周五