从读到写

一、生命语言的读

1977年,弗雷德里克·桑格(Frederick Sanger)用双脱氧法测定了噬菌体φX174的基因组序列,长度为5386个碱基,这是人类第一次测定一个生物体完整的基因组。但事实上这是指第一个DNA的基因组测定,第一个RNA的基因组测定其实是噬菌体MS2,由比利时根特大学的瓦尔特·菲尔斯(Walter Fiers)在1976年鉴定并公布,比前者早一年。也正是基于桑格的第一个DNA噬菌体测序,估算一个碱基的测序成本约为10美金,这就是最早人类基因组计划预估300亿美金的由来。
1980年,桑格与沃尔特·吉尔伯特(Walter Gilbert)和保罗﹒伯格(Paul Berg)一起分享了诺贝尔化学奖,成为历史上唯一一位两次荣获诺贝尔化学奖的科学家。
利用Sanger双脱氧终止法的测序原理,结合荧光标记和毛细管阵列电泳技术来实现测序的自动化,很多物种的基因组破译得以实现。Sanger测序技术的优点是测序读长长,能达到800-1K bp,且用时短,只需要几十分钟即可完成一次测序,准确度高达99.999%,目前仍是测序的金标准;2001年完成的首个人类基因组图谱就是以改进了的Sanger法为其测序基础。缺点是通量低、成本高,影响了其真正大规模的应用。
此后,第一个测序的模式植物拟南芥于2000年完成。重要的粮食作物水稻基因组于2002年完成,第一个测序的家禽家鸡基因组于2004年完成,高重复玉米基因组于2009年完成,这几个项目华大都深度参与了。
短读长测序快速崛起2010年,大熊猫基因组测序研究项目完成,绘制出基因组精细图。这是中国科学家第一次全面系统地对大熊猫基因组进行测序研究,也是全球第一个完全使用短读长合成法测序技术完成的基因组序列图,全部组装和分析软件都是深圳生命科学研究院(原深圳华大基因研究院)自主编写。这一成果证明了短序列也能组装成完整基因组,并成为基因组绘图的国际标准,集中体现了中国的科技竞争力和中国科学家的创新能力。
短读长测序系统在2005-2007年因其可同时进行大量平行测序反应而广为人知。这些系统可以同时分析百万甚至上亿个序列反应。短读长测序技术相比Sanger测序大幅降低了成本,保持了较高准确性,并且大幅降低了测序时间,将一个人类基因组测序从数年降至几天之内。
自从有了短读长大规模高通量并行测序技术,行业真正进入到物种破译的“寒武纪”。2011年的土豆基因组、2012年第一个软体动物牡蛎基因组、2012年第一个六倍体物种小麦基因组、2013年复杂昆虫小菜蛾基因组、2014年火炬松基因组(迄今最大的植物基因组)的测序相继完成。

长读长测序技术以其独特的长读长优势,可以很好地解决复杂基因组组装的难题。2015年发表在Nature上的复活草基因组文章,利用纯长读长测序技术完成,相比短读长测序的动植物基因组,在组装质量上有了很大改善 。
2016年海马基因组、银杏基因组,2017年人参基因组、潘那利番茄基因组,2018年六角恐龙/蝾螈基因组(迄今为止最大的基因组)、3000株水稻项目纷纷完成。其中3000株水稻项目首次实现了在顶级期刊Nature中使用汉字。2019年,首次对整个云南瑞丽植物园的761份样本进行全基因组测序,在植物研究史上添上了浓墨重彩的一笔。

二、生命语言的写


三、生命语言的发展和未来


四、不应被遗忘的“基因传”
首次合成结晶牛胰岛素
1958年,我国科学家提出人工合成胰岛素的设想,当时国际上最高的科研水平,也只能合成由19个氨基酸组成的多肽。胰岛素虽然是相对分子质量较小的蛋白质,但是也由17种、51个氨基酸、两条肽链组成。经过6年多的艰苦努力,1965年9月17日,中国科学家首次用人工方法合成了结晶牛胰岛素。
真正的DNA测序之父——吴瑞
1968年至1972年的几年时间里,康奈尔大学的华人科学家吴瑞在DNA测序方面发表多篇文章。其中吴先生1968年的第一篇论文测定了DNA的碱基组成,1970年的新文章既测定DNA碱基组成又测定出顺序,是真正的DNA测序第一人。而在吴瑞先生工作的启发下,Sanger深入研究,改进了之前的方法,才最终确立了DNA测序的主流方法Sanger法。在DNA测序史上,吴瑞先生的贡献不应被忽略。





评论 (0)