DeepSeek与华为推出面向昇腾芯片的开源编程工具
DeepSeek与华为合作推出面向华为昇腾芯片的开源编程工具,核心是TileLang,另包括计算库和芯片间数据传输库。双方还优化了由128颗昇腾950芯片组成的超节点。文章指出,完善软件生态是国产芯片竞争中的重要环节,并讨论了CUDA生态优势与相关基准测试的局限。
DeepSeek与华为合作推出面向华为昇腾芯片的开源编程工具,核心是TileLang,另包括计算库和芯片间数据传输库。双方还优化了由128颗昇腾950芯片组成的超节点。文章指出,完善软件生态是国产芯片竞争中的重要环节,并讨论了CUDA生态优势与相关基准测试的局限。
Anthropic称,智谱开源权重模型GLM-5.3在漏洞利用测试中接近Claude Mythos Preview。ExploitBench上,GLM-5.3在410次尝试中成功构建50次漏洞利用,Mythos Preview为56次;另一项二进制利用测试的成功率分别为4%和6%。
Simon Willison 发布 commit-rewriter 0.2 版本更新记录。该动态同时介绍了其每月 10 美元的赞助订阅计划,订阅者可获取当月重要 LLM 进展的精选邮件汇总。
NVIDIA与Google DeepMind等全球研究机构发布了覆盖2,800多种病毒蛋白复合物的预测3D结构数据集,并将其开放至AlphaFold Database。团队还开放了BioNeMo Structure Prediction Pipeline,研究人员可用它从蛋白质序列生成预测的3D结构。新加入数据库的蛋白质相互作用中,约30%此前未被科学界记录。
推荐理由:这项发布同时提供大规模病毒蛋白复合物预测数据与生成流程,呈现开放结构数据如何为后续病毒研究积累可探索的线索。
NVIDIA与合作伙伴在新加坡 AI Day 展示东南亚 AI 进展,涵盖公共部门应用、区域化模型和产业场景。泰国 iApp Technology 基于 Nemotron 3 Nano 微调 OpenThai 2.0 Legal,并将模型开源,作为已服务约 43,000 名用户的 Thanoy 法律助手引擎。
Simon Willison 发布了 llm 0.36 相关动态。此外,读者可通过每月 $10 赞助订阅月度简报,获取当月最重要的大语言模型技术进展精选邮件。
Simon Willison 发布了 llm-anthropic 0.29。此外,作者同步提供每月 10 美元的大语言模型月度重点进展精选邮件简报订阅服务。
Simon Willison 发布了 LLM 工具的新插件 llm-typesafe 0.1a0,为命令行工具新增对 TypeSafe AI 旗下 Jev 模型的支持。用户可通过 pip 安装并设置 API key,直接调用 Jev 模型完成 yes/no 概率判定(noul)、多项分类以及打分评估等结构化任务。
小米推出 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 具备 1.02T 总参数和 42B 激活参数,并公开了强化学习训练配方与环境代码。本期综述同时汇总了 Jev 决策模型应用、Hugging Face tokenizers v1 RC 等推理与训练工具升级,以及千问 Qwen-Image-2.1 开源模型的相关进展。
TypeSafe AI 推出了名为 Jev 的“系统一决策模型”,它接收文本输入后直接返回分类、是非判断和评分对应的浮点数与置信度,输出不计费且输入单价为 $0.042 per M tokens。
推荐理由:文章剖析了只输出概率数值的决策模型架构,读者可以了解这种极低成本方案在搜索重排中的用法与黑盒偏差隐患。
Microsoft Research 在 Nature 发表 RetroChimera 逆合成预测研究,并开源其实现与权重。该模型结合 R-SMILES 2 和 NeuralLoc,通过学习排序整合两者的预测。在专家盲测中,化学家更偏好 RetroChimera 的单步反应预测;多步路线评估中,它在 10 个复杂目标上成功完成 9 个。
非生成式判别决策模型 Jev 闭源发布后,开源社区在 2 天内推出了 Laya、Bespoke Nimble、Kev-0.5B 等 6 款复刻模型。其中 Bespoke Nimble 基于 Qwen3.5-9B 进行 LoRA 微调,评测准确率达 90% 且在 H100 上耗时 100ms;Kev-0.5B 则基于 Qwen2.5-0.5B 可在笔记本本地运行。