ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

GitHub AI4S 项目观察(2026-08-07—2026-08-13)

GitHub AI4S 项目观察(2026-08-07—2026-08-13) 项目速览项目Star 数统计时间主要功能AI4S 领域本期动态ToolUniverse1,6272026-08-14 10:12让 AI 模型统一检索、调用并组合科学数据、模型和软件工具科研智能体、生物医药与科研数据v1.4.1 提升数据返回可靠性与安装体验ForgeStencil602026-08-14 13:55用双智能体发现 CUDA 模板计算优化策略并集成到真实应用中验证高性能计算、GPU 优化、科学计算智能体8 月 4 日首次公开提供 100 个应用复现包ColabFold2,8762026-08-14 10:12从蛋白质序列生成三维结构、复合物模型与置信度结果结构生物学、蛋白质研究增加复合物界面置信度评分BioNeMo Recipes8432026-08-14 10:12提供可扩展的生物基础模型训练、微调与推理参考流程生物医药、基因组与药物发现Evo2 支持并行批量生成Scanpy2,5392026-08-14 10:12从单细胞表达矩阵完成质控、聚类、轨迹和差异基因分析单细胞组学、生物信息学优化 Harmony 批次整合默认设置1. ToolUniverse让 AI 先找到合适的科学工具再按统一方式执行ToolUniverse 是一个为科研智能体准备的开源工具平台。科研智能体是能够根据任务自行选择并调用工具的 AI 程序。可以把 ToolUniverse 理解成科学工具的“统一目录和转接层”语言模型不必分别学习每个数据库、分析软件和预测模型的调用方式只需按照同一套说明查找工具、填写参数并读取结果。它不是替研究者下结论的聊天机器人主要作用是把原本分散的科研资源连接起来。用户提出科研任务后ToolUniverse 会先从工具库中筛选合适的选项检查参数再调用相应服务。多个工具既可以依次执行也可以并行运行或者根据前一步结果反复调整。据项目论文 2026 年 7 月的统计工具库当时已经收录超过 2,700 个工具涉及数据集、机器学习模型、科学软件、文献检索和实验接口等类别。任务结束后系统会留下查询结果、模型预测、证据汇总和调用记录方便研究者检查每一步用了什么数据、做了什么操作。该项目由哈佛医学院生物医学信息学系牵头哈佛大学、麻省理工学院及相关研究机构参与。本期发布的 v1.4.1 增加了基因安全性评估流程并修复了若干数据返回和安装问题。图ToolUniverse 统一管理科学工具与领域技能再把它们交给语言模型或智能体完成假设生成、实验设计、数据分析和证据汇总来源ToolUniverse 原始论文Figure 1。资料来源官方 GitHub 仓库访问日期2026-08-14哈佛医学院项目团队页面访问日期2026-08-14v1.4.1 Release发布2026-08-12访问日期2026-08-14原始论文修订2026-08-07访问日期2026-08-14。2. ForgeStencil让智能体把模板计算优化真正部署进科学软件ForgeStencil 是一套用大语言模型智能体优化 CUDA 科学计算程序的开源系统主要面向模板计算Stencil Computation的性能优化。在这类计算中规则网格上每个点的新值都由自身和周围一小片邻域共同决定。流体力学、电磁仿真、气候模拟和医学成像中都能见到这种模式。模板计算往往要在大规模网格上重复很多次因此即使单次更新只快一点也可能显著缩短整个程序的运行时间。ForgeStencil 使用两个分工不同的智能体。Kernel Agent 负责研究底层计算内核在“规划—编码—性能分析”的循环中尝试分块、融合、数据布局和主机端重构等办法并把效果较好的 CUDA 内核放入库中。App Agent 面向具体软件先找出最耗时的部分再选择或改造合适的内核将它接入原程序。接入后系统使用应用自带的正确性检查和计时器对原始版本与优化版本进行交错测试。这样留下的不只是一个代码片段还包括集成补丁、软件来源记录、复现脚本和端到端性能数据。Kernel Agent规划—编码—性能分析优化内核库App Agent热点定位—适配—集成应用内正确性检查交错性能测量结果注册表图ForgeStencil 先由 Kernel Agent 生成并积累优化内核再由 App Agent 将内核部署到真实应用中验证根据项目官方架构图整理。项目由 OpenBMB 组织开源仓库于 2026-08-04 首次公开。仓库为 100 个应用准备了复现包涉及油气、电磁、医学成像、流体、气候、天体物理和材料等场景。项目自己的结果注册表显示端到端加速的中位数为 1.41 倍几何平均为 2.05 倍。这些数字需要结合测试条件理解目前 100 个应用只在 A100 上完成了端到端验证实际速度还会受到 GPU 型号、节点负载和原程序优化程度的影响如果应用自带的正确性检查不够严格验证结果也会受到限制。资料来源官方 GitHub 仓库访问日期2026-08-14中文项目说明访问日期2026-08-14双智能体工作机制访问日期2026-08-14GitHub API 仓库记录仓库创建2026-08-04 00:22Asia/Shanghai访问日期2026-08-14。3. ColabFold从蛋白质序列快速得到三维结构与可信度线索ColabFold 是一套免费、开源且较容易上手的蛋白质结构预测工具。它不是 AlphaFold2 的简单“社区复刻版”也没有重新发明一个结构预测模型它所做的是把 AlphaFold2 等模型与更快的序列搜索方法组合起来再封装成可在浏览器中运行的 Google Colab 笔记本和命令行程序。这种组合既简化了安装和使用步骤也缩短了序列搜索与数据准备时间让没有专门计算团队的实验室也能较方便地开展结构预测。使用者只需提供 FASTA 或 CSV 格式的氨基酸序列也可以一次提交由多条蛋白链组成的复合物。ColabFold 首先用 MMseqs2 寻找相似序列并建立多序列比对。所谓多序列比对就是把一批相关蛋白质的序列按照同源位置排齐。空间上彼此关联的氨基酸位置往往会在演化过程中表现出协同变化这些规律能为蛋白质的三维结构提供线索。随后AlphaFold 系列模型会利用这些信息预测蛋白质单体或复合物的三维形状。预测完成后ColabFold 会给出 PDB 三维坐标、可视化图片和多种置信度指标。这些指标能帮助研究者判断哪些局部结构较可靠、哪些链间接触值得进一步验证但预测结果仍不能代替实验测定。项目由德国马克斯·普朗克多学科科学研究所、首尔大学、东京大学、密歇根州立大学和哈佛大学等机构合作开发。本期没有发布新版本不过新增了两项复合物界面置信度评分使链间结合的判断更直观。图使用者可以从网页或命令行提交序列。ColabFold 经 MMseqs2 生成多序列比对再预测单体或复合物结构并给出序列覆盖度和置信度图来源ColabFold 原始论文Figure 1。资料来源官方 GitHub 仓库访问日期2026-08-14原始论文与机构信息在线发表2022-05-30访问日期2026-08-14本周期功能提交提交2026-08-10 13:54Asia/Shanghai访问日期2026-08-14。4. BioNeMo Recipes把生物基础模型原型扩展到多 GPU 训练与批量生成BioNeMo Recipes 是 NVIDIA 开源的一组生物基础模型训练配方和参考代码。这里的“配方”不是一个可以直接点开使用的应用而是一套经过组织的示例数据怎样准备、模型怎样配置、训练怎样从一张 GPU 扩展到多台机器都能在代码中找到对应做法。生物基础模型则是从大量蛋白质、DNA 或单细胞数据中学习一般规律的大模型之后还可以针对具体研究任务继续训练。项目为 ESM-2、Geneformer、AMPLIFY 和基因组模型等方向提供参考流程并尽量与常见的 PyTorch 工具兼容。研究者可以从已有检查点继续预训练或微调训练过程会产生新的模型检查点和日志也可以使用训练好的模型执行推理得到生成序列等结果。基准测试脚本还会记录吞吐量帮助使用者比较不同训练配置的运行效率。BioNeMo Recipes 的价值在于提供一套可修改、可扩展的工程起点而不是替使用者包办数据处理和模型选择。要真正运行这些配方仍然需要相应的 GPU 资源和分布式训练经验。BioNeMo Recipes 由 NVIDIA BioNeMo 团队维护。本期更新为基因组基础模型 Evo2 加入了并行批量生成能力使多条输入序列可以同时推理项目同时更新了部分运行环境配置。图官方 ESM-2 预训练配方在两节点、16 张 GPU 上比较不同训练实现的每卡吞吐量用于说明 Recipes 面向可扩展训练的定位来源BioNeMo Recipes 官方文档。资料来源官方 GitHub 仓库访问日期2026-08-14NVIDIA BioNeMo 官方文档访问日期2026-08-14本周期功能提交提交2026-08-08 02:43Asia/Shanghai访问日期2026-08-14BioNeMo Framework 原始论文访问日期2026-08-14。5. Scanpy把单细胞表达矩阵变成细胞群、标记基因和变化轨迹Scanpy 是一个用 Python 分析单细胞基因表达数据的开源工具箱。它把数据清洗、统计分析和可视化步骤放在同一套工作流程中。单细胞测序会分别记录许多细胞中各个基因的活跃程度得到一张规模很大的“细胞 × 基因”表达矩阵。Scanpy 使用 AnnData 格式保存这张矩阵同时记录样本来源、细胞类型和基因注释等信息。分析通常从去除低质量细胞、统一不同细胞的表达量开始。随后Scanpy 可以把包含数千个基因的高维表达数据压缩成较少的特征再根据这些特征寻找相似细胞、划分细胞群并比较不同细胞群中哪些基因更活跃。研究者由此可以获得二维分布图、细胞群标签、标记基因表以及描述细胞发育或状态变化的轨迹。对于来自不同实验批次的数据Scanpy 还可以调用 Harmony 等方法减小技术差异避免把实验条件造成的偏差误认为真实的生物差异。项目由 scverse 开源共同体维护并由 NumFOCUS 提供财政支持。本期更新调整了 Harmony 第二代实现的默认停止条件让算法在结果已经稳定时及时停止减少不必要的迭代项目还完成了少量文档维护。图Scanpy 从预处理和可视化进入聚类、差异表达与伪时间轨迹分析并展示大规模单细胞数据的结果来源Scanpy 原始论文Figure 1。资料来源官方 GitHub 仓库访问日期2026-08-14scverse 官方介绍访问日期2026-08-14本周期功能提交提交2026-08-13 22:59Asia/Shanghai访问日期2026-08-14原始论文发表2018-02-06访问日期2026-08-14。
返回列表