ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

革命性TCR序列生成工具TCRT5-FT-TCRDB:如何用AI预测抗原特异性T细胞受体?

革命性TCR序列生成工具TCRT5-FT-TCRDB:如何用AI预测抗原特异性T细胞受体? 革命性TCR序列生成工具TCRT5-FT-TCRDB如何用AI预测抗原特异性T细胞受体【免费下载链接】tcrt5_ft_tcrdb项目地址: https://ai.gitcode.com/hf_mirrors/dkarthikeyan1/tcrt5_ft_tcrdbTCRT5-FT-TCRDB是一款基于T5架构的革命性AI工具专为预测抗原特异性T细胞受体TCR序列设计。作为seq2seq模型它能根据目标肽-MHCpMHC条件生成TCR序列为免疫学研究和免疫治疗开发提供强大支持。什么是TCRT5-FT-TCRDBTCRT5-FT-TCRDB是在T5架构基础上构建的transformers模型通过HuggingFace接口实现操作。该模型基于dkarthikeyan1/tcrt5_pre_tcrdb预训练模型进行微调专门用于条件性生成针对特定pMHC的CDR3β序列。核心功能与优势双重生成模式支持条件生成给定pMHC和无条件生成两种模式高准确率在验证集上实现96.4的Char-BLEU分数和89.2%的序列回收率多样化输出可通过调整解码策略生成不同多样性的TCR序列学术级性能经过严格的训练和验证达到Nature Machine Intelligence发表水平快速上手TCRT5-FT-TCRDB使用指南环境准备使用前需安装transformers库并确保模型文件正确加载。核心模型文件包括配置文件config.json分词器配置tokenizer_config.json模型权重model.safetensors特殊 tokens 映射special_tokens_map.json条件生成CDR3β序列最常用的功能是根据给定的pMHC生成特异性TCR序列from transformers import T5Tokenizer, T5ForConditionalGeneration tokenizer T5Tokenizer.from_pretrained(dkarthikeyan1/tcrt5_ft_tcrdb) tcrt5 T5ForConditionalGeneration.from_pretrained(dkarthikeyan1/tcrt5_ft_tcrdb) # 输入pMHC序列 pmhc [PMHC]KLGGALQAK[SEP]YFAMYQENVAQTDVDTLYIIYRDYTWAELAYTWY[EOS] encoded_pmhc tokenizer(pmhc, return_tensorspt) # 生成10个TCR序列推荐beam数量为TCR数量的3倍 outputs tcrt5.generate(**encoded_pmhc, max_new_tokens25, num_return_sequences10, num_beams30) # 提取CDR3β序列 cdr3b_sequences [re.sub(r\[.*\], , x) for x in tokenizer.batch_decode(outputs[sequences], skip_special_tokensTrue)]生成结果示例 [CASSLGTGGTDTQYF, CASSPGTGGTDTQYF, CASSLGQGGTEAFF, CASSVGTGGTDTQYF, ...]无条件生成CDR3β序列若无需特定pMHC也可进行无条件生成# 无需输入pMHC直接生成 unconditional_outputs tcrt5.generate(max_new_tokens25, num_return_sequences10, num_beams30) uncond_cdr3b_sequences [re.sub(r\[.*\], , x) for x in tokenizer.batch_decode(unconditional_outputs[sequences], skip_special_tokensTrue)]模型性能与评估指标TCRT5-FT-TCRDB在20种常见肽-MHC组合的验证集上表现优异指标数值说明Char-BLEU96.4字符级BLEU分数衡量序列相似度F1000.09前100个序列中的F1分数SeqRec%89.2序列回收率多样性1300 (2000 max)生成序列的多样性平均Jaccard相异度94.4/100序列间差异度困惑度2.48模型预测不确定性优化生成多样性的技巧默认使用beam search解码可获得较高准确率但会降低序列多样性。若需更多样化的结果可尝试祖先采样(Ancestral Sampling)温度调整(Temperature Adjustment)Top-k/Top-p采样详细方法可参考HuggingFace的生成策略文档。模型训练与数据来源训练数据构成TCRT5-FT-TCRDB的训练数据来自多个权威数据库预训练~14M TCR序列来自TCRdb和~740k肽-伪序列对来自IEDB微调~330k TCR:肽-伪序列对整合自VDJdb、IEDB、McPAS和MIRA训练流程预处理使用tidytcells标准化氨基酸序列和V/J基因名称mhcgnomes标准化MHC等位基因信息预训练采用掩码语言模型(MLM)进行跨度重建掩盖15%的序列并训练模型重建微调使用肽-伪序列→CDR3β的源-目标对通过交叉熵损失进行训练应用场景与限制适合的应用场景免疫学研究探索TCR与pMHC相互作用机制疫苗开发预测针对特定抗原的潜在TCR序列免疫治疗辅助设计肿瘤特异性TCR基础研究T细胞受体库多样性分析使用限制非临床用途模型仅用于学术研究不可用于临床环境低亲和力pMHC未在低亲和力肽-MHC上测试可能影响预测效果序列偏好倾向于生成高V(D)J重组概率的序列可通过替代解码方法缓解引用与学术信息如果使用TCRT5-FT-TCRDB请引用以下文献Article{Karthikeyan2025_tcrtranslate, author{Karthikeyan, Dhuvarakesh and Bennett, Sarah N. and Reynolds, Amy G. and Vincent, Benjamin G. and Rubinsteyn, Alex}, title{Conditional generation of real antigen-specific T cell receptor sequences}, journal{Nature Machine Intelligence}, year{2025}, month{Sep}, day{08}, doi{10.1038/s42256-025-01096-6} }开始使用TCRT5-FT-TCRDB要开始使用这个强大的TCR序列生成工具首先克隆仓库git clone https://gitcode.com/hf_mirrors/dkarthikeyan1/tcrt5_ft_tcrdb然后参考README.md中的详细说明进行安装和使用。无论是免疫学研究人员还是生物信息学开发者TCRT5-FT-TCRDB都能为您的工作流程带来革命性的改变【免费下载链接】tcrt5_ft_tcrdb项目地址: https://ai.gitcode.com/hf_mirrors/dkarthikeyan1/tcrt5_ft_tcrdb创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表