跳到正文

#编码

今日 3 条
今天10月1日周四
  1. The Verge · AI75

    Google 发布前沿模型 Gemini 4 Argon,初期仅对受信任网络防御者开放

    Google 正式公布下一代前沿 AI 模型 Gemini 4 Argon,在软件工程、法律财务等企业知识工作以及网络安全防御方面具备前沿性能。出于安全考量,Google 初期仅向受信任的网络防御者开放访问,并参与美国政府的模型发布前自愿审查流程。该模型目前已在 Google 内部用于大规模代码库迁移等工作流,在基准测试中优于 OpenAI 和 Anthropic 的同类模型。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿大模型

    Google DeepMind 正式公布新一代前沿模型 Gemini 4 Argon,单次输出 token 上限提升至 1M tokens,主打真实软件工程、企业知识工作与网络安全防御等复杂长流程任务。

    推荐理由:模型将单次输出上限拓展至 1M tokens 并主打深度推理与网络防御,读者可据此评估长流程任务与企业级自动化的落地潜力。

  3. AWS Machine Learning Blog83

    Claude Sonnet 5.5 正式上线 AWS Amazon Bedrock

    AWS 宣布 Claude Sonnet 5.5 正式上线 Amazon Bedrock 与 Claude Platform on AWS。该模型针对明确范围的编码与知识工作进行了优化,具备更快的生成速度和更低的单任务成本,支持生成架构图等更精细的文档。开发者可通过 Bedrock 控制台、Anthropic SDK 或 AWS SDK(Boto3)调用 global 推理配置文件接入使用。

    推荐理由:原文梳理了 Sonnet 5.5 在 Bedrock 上的适用场景与调用代码,开发者可据此评估其与 Opus 5.5 的分工配合。

9月30日周三
  1. AWS Machine Learning Blog65

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,为智能体编码、计算机操作和专业工作负载带来更强推理能力。OpenAI 称,该模型在 DeepSWE v1.1 上匹配 GPT-6 Astra,单任务成本约为其五分之一;它还以低于 GPT-6 Sol 对应结果的推理力度,高出 6.4 个百分点。

    推荐理由:文章将智能体任务成本与交互 token 价格、推理质量联系起来,并以 DeepSWE v1.1 的对比数据展示 GPT-6.1 Sol 的任务成本表现。

9月29日周二
  1. Simon Willison82

    OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol 等产品与模型

    OpenAI 在 DevDay 2026 发布 Dots 智能体,并推出 GPT-6.1 Sol、Ultrafast 等模型与服务更新。ChatGPT Pro 和 Enterprise 用户当天可使用 Dots;Ultrafast 提供最高 300 tokens/second 的速度,Codex Security Cloud 也推出升级版并计划当天普遍开放。

    推荐理由:这份现场记录将 Dots、模型与 API 更新、开发者工具发布串联起来,呈现 OpenAI 面向个人智能体和开发者的产品布局。

  2. OpenAI News73

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,称其在编码、电脑操作和专业工作方面具备接近 Astra 的智能水平,标准 API 输入和输出 token 价格为 Astra 的五分之一。

    推荐理由:材料将 GPT-6.1 Sol 定位为面向编码、电脑操作和专业工作的模型,并以 Astra 标准 API 输入与输出 token 价格的五分之一作为核心成本比较。

  3. Latent Space58

    Thariq Shihipar 谈 Claude Code 的下一阶段

    Latent Space 采访 Anthropic 的 Thariq Shihipar,讨论 Claude Code 的演进方向及智能体安全。访谈涉及 Claude Mods 对 harness 执行流程和界面的定制、Artifacts、Claude Tag 与 Projects,也谈到提示词实践、沙箱、Prompt injection、分类器、探针、回退机制和 Auto Mode。

  4. Simon Willison71

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,并称其运行速度提升 30% 以上,多数工作成本最高降低 30%。该模型定价与 Sonnet 5 相同,作者称它在各项基准上似乎都胜过前代,并指出它已用于 claude.ai 免费层。作者用 WebGL 提示词测试免费层,获得了一个渲染 3D 骑车鹈鹕的 HTML 页面。

9月28日周一
  1. Simon Willison67

    Simon Willison 回顾 2026 年至今的大语言模型关键趋势

    Simon Willison 在 WeAreDevelopers World Congress North America 的闭幕主题演讲中,按时间回顾 2026 年至今的大语言模型发展,重点包括编码智能体从常出错到日常可用的变化。他还讨论了本地开源权重模型的进步、智能体使用成本与软件工程师工作变化。演讲也梳理了 OpenAI、Anthropic 训练智能体越界及相关安全事件。

9月27日周日
  1. Simon Willison53

    Simon Willison 借助 Claude Opus 5.5 与 Claude Code 制作像素动画及自动化录屏

    Simon Willison 演示了结合 Claude Opus 5.5 和 Claude Code 快速制作演讲幻灯片动态素材的全流程。他提供参考照片与提示词让 Claude Opus 5.5 生成了包含 20 多只像素鸮鹦鹉跳舞互动的 HTML5 Canvas 网页,随后指示本地 Claude Code 调用 Playwright 编写自动化脚本模拟点击并录制成 15 秒视频。

9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML70

    GitHub Security Lab 开源 Fuzzing Taskflow 自动化模糊测试工具

    GitHub Security Lab 推出开源 Fuzzing Taskflow,为 C/C++ 项目提供由 LLM Agent 驱动的自动化模糊测试流程。它会迭代改进 harness、追踪覆盖率缺口,并自动分诊崩溃、生成漏洞报告。该工具会在宿主机运行 AFL++、clang 和 LLM 选择的构建命令,作者建议仅在临时环境中运行;报告和建议补丁仍需人工复核。

    推荐理由:文章拆解了覆盖率反馈如何驱动 harness、输入字典和种子迭代,并说明自动化崩溃分诊仍需人工复核,可借此理解流程设计与边界。

9月24日周四
  1. GitHub Blog · AI & ML57

    GitHub Copilot app 如何流畅渲染超大型 Pull Request

    GitHub 在 GitHub Copilot app 重建了 Pull Request 视图,使超大型 diff 也能保持流畅渲染与滚动。团队用一个包含 2,200 个文件、超过 100 万行改动和 400 多条行内评论的开源 PR 检验性能。实现上将确定的代码行几何与动态评论区块分开处理,并结合延迟测量、滚动锚点校正和自动化性能检测。

  2. Simon Willison29

    通过可交互示例详解 Shadow roots

    该交互式工具通过具体示例解析 Shadow roots 与 Shadow DOM 的工作原理。内容演示了样式封装、继承、slots、parts 以及 JavaScript 访问机制,展示 shadow roots 如何构建带有私有样式和元素的隔离 DOM 树,并以受控方式与页面 DOM 交互。该演示由针对 Fable 5.1 Medium 的提示词生成。

9月23日周三
  1. Latent Space88

    Anthropic 发布 Claude Opus 5.5 与 OpenAI 推出 GPT-6 Sol/Luna 引发模型降价潮

    Anthropic 正式发布新一代旗舰模型 Claude Opus 5.5,OpenAI 随后推出价格降低约 50% 的 GPT-6 Sol 与 Luna。Opus 5.5 在 Agent 编码、计算机使用和写作能力上显著提升,默认设置下单任务运行成本较 Opus 5 降低约 40%,但高推理强度下 Token 消耗会有所增加。

    推荐理由:两家厂商在同一天密集更新模型并大幅下调价格,读者可以据此对比多任务评测与真实调用成本的变化。

9月21日周一
  1. Simon Willison55

    大厂工程师自述全流程依赖 Claude Code 的工作异化现状

    大厂新入职工程师 voxium 发文描述,其所在团队的规范、代码、测试、PRD 和工单已全由 Claude Code 生成,团队被迫最大化交付速度。管理层认为代码产出不再是瓶颈并催促进度,导致从 L1 到 L7 的工程师每天工作 12 至 13 小时仅用来与 Claude 对话和按回车确认,实际上无人阅读生成的具体内容。

  2. Simon Willison54

    Simon Willison 发布 llm 插件 llm-keys-ui 0.1

    Simon Willison 发布 llm-keys-ui 0.1 插件,用于在通过手机控制远程编码智能体时向机器配置 API 密钥,避免直接在对话窗口中明文粘贴。用户可通过 `uvx --with llm-keys-ui llm keys-ui --all` 命令启动 Web 界面输入密钥,远程环境后续可直接通过命令行读取并使用。

9月18日周五
9月17日周四
  1. GitHub Blog · AI & ML78

    GitHub 借助 Copilot 将 Copilot agent runtime 迁移至 Rust

    GitHub 将 Copilot agent runtime 从 TypeScript 迁移为 Rust,最终包含 832,378 行生产 Rust;作者称 AI agents 编写了大部分代码,运行时性能提升了数个数量级。

    推荐理由:文章把迁移策略、跨语言 FFI 设计与测试发布节奏串联起来,展示逐组件替换如何在持续开发中控制回归风险。

9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML54

    GitHub Copilot app 入门:使用差异面板、终端和浏览器

    GitHub Copilot app 的内置差异、终端和浏览器面板,让用户无需离开应用即可审查智能体的代码变更、运行代码并测试界面。网站示例中,用户可以运行 `npm run dev`,再用 Pick & Polish 选择界面元素并让智能体调整。确认功能可用后,用户可以在 Copilot app 中接受修改并创建 pull request。

9月9日周三
9月8日周二
9月5日周六
9月4日周五
  1. GitHub Blog · AI & ML65

    GitHub Copilot app 初学者指南:如何同时运行多个智能体

    GitHub Copilot app 支持通过并行智能体会话同时执行多个开发任务。每个会话运行在独立的 Git worktree 上并保留各自上下文,彼此互不干扰且无需等待上一个任务完成。开发者可以在统一的会话视图中跟踪各项任务进度并集中审查结果,降低多任务切换成本。

    推荐理由:原文介绍了利用 Git worktree 隔离机制实现多智能体并行执行的具体机制,有助于开发者优化多任务协同工作流。