2 पॉइंट द्वारा GN⁺ 2023-08-26 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • लंबे palindromic ढांचों और repetitive sequences की वजह से अंत तक खाली रह गया Y क्रोमोसोम T2T-Y के रूप में पूरा हुआ, जिससे मानव reference genome की एक बड़ी खाली जगह भर गई
  • मौजूदा GRCh38-Y में Y क्रोमोसोम का आधे से अधिक हिस्सा गायब था, और नया sequence 62,460,029 base pairs (bp) का है, जिसमें 30 मिलियन bp से अधिक जोड़े गए
  • पूर्ण sequence ने TSPY, DAZ, RBMY gene families की ampliconic संरचना और TSPY family के प्रभुत्व वाले 41 protein-coding genes को और उजागर किया
  • Yq12 heterochromatin क्षेत्र में human satellite 1·3 blocks बारी-बारी से दिखाई देते हैं, जिससे पूरे क्रोमोसोम में repeat sequences, satellite DNA और non-B DNA motif के वितरण का विश्लेषण संभव हुआ
  • T2T-Y को CHM13 genome assembly के साथ जोड़कर सभी 24 मानव क्रोमोसोम के लिए पूर्ण reference sequence resource के रूप में इस्तेमाल किया जाता है

अंत में बची हुई Y क्रोमोसोम की खाली जगह

  • मानव Y क्रोमोसोम में लंबे palindrome structures, tandem repeats और segmental duplications सहित जटिल repetitive structures होने के कारण sequencing और assembly बेहद कठिन थे
  • GRCh38 reference sequence में Y क्रोमोसोम का आधे से अधिक हिस्सा गायब था, और Y क्रोमोसोम अधूरा रह गया अंतिम मानव क्रोमोसोम था
  • T2T consortium ने HG002 genome से निकले मानव Y क्रोमोसोम का पूर्ण 62,460,029 bp sequence, T2T-Y, पूरा किया
  • T2T-Y ने GRCh38-Y की कई गलतियां सुधारीं और reference sequence में 30 मिलियन bp से अधिक जोड़ा

नए उजागर हुए genes और repetitive structures

  • T2T-Y TSPY, DAZ, RBMY gene families की पूर्ण ampliconic संरचना दिखाता है
  • नए reference sequence में TSPY family के प्रभुत्व वाले अतिरिक्त 41 protein-coding genes शामिल हैं
  • Yq12 heterochromatin क्षेत्र में human satellite 1 और 3 blocks के बारी-बारी से आने का pattern पुष्टि किया गया
  • assembly पूरी होने से Y क्रोमोसोम repeat sequences का व्यापक मूल्यांकन संभव हुआ, और पहले अज्ञात satellite array भी पहचाने गए
    • नया satellite array मुख्य रूप से PAR1 में था
    • TSPY, RBMY, DAZ में से किसी एक के composite repeat unit के अंदर आने वाले subunit repeat भी पहचाने गए

assembly प्रक्रिया में सामने आई संरचनात्मक कठिनाइयां

  • HG002 के X/Y क्रोमोसोम assembly का विश्लेषण HiFi reads आधारित assembly string graph से किया गया
    • सबसे जटिल tangled structure Y q-arm के heterochromatic satellite region तक सीमित था
    • X/Y subgraph PAR1 और PAR2 में जुड़ा था
  • PAR1 में HiFi sequencing bias के कारण graph discontinuity देखी गई
    • देखे गए 11 breaks में से 9 दोनों क्रोमोसोम के PAR1 में थे
    • Y क्रोमोसोम में 5 में से 5 break PAR1 में थे
  • P1–P3 palindromic region में manual pruning और ONT read integration से repetitive structures को हल किया गया
    • P3 पूरा और P2 के दो palindromes शामिल करने वाली लगभग पूर्ण inverted tandem repeat जैसी 3 hairpin structures को highlight किया गया
    • बची हुई ambiguity को candidate reconstructions पर ONT read alignment evaluation से हल किया गया

Strand-seq और variant analysis validation

  • 65 Strand-seq libraries की GRCh38-Y और T2T-Y के विरुद्ध तुलना करने पर, GRCh38-Y में reverse direction coverage spike कई जगह दिखाई दिए
    • ये spike HG002 के साथ inversion polymorphism का संकेत देते हैं, और संभवतः haplogroup difference के कारण हो सकते हैं
    • T2T-X और T2T-Y में वही spike नहीं देखे गए, जिससे HG002 assembly की संरचना और दिशा की शुद्धता की पुष्टि हुई
  • P5 palindromic arm के बीच unique sequence में 3 kb inversion को T2T-Y error के रूप में पहचाना गया, लेकिन population polymorphic होने की पुष्टि होने पर इस assembly version में इसे सुधारा नहीं गया
  • T2T-Y में हर Strand-seq library में strand state change random रूप से वितरित है, जिससे misassembly या collapse का evidence नहीं मिलता
  • Extended Data analysis में 15 में से 5 लोगों में HG002 में मौजूद P3 palindrome inverted variant होने की पुष्टि हुई

PAR, Yq12, non-B DNA motif

  • PAR1 subgraph में green edge gap और असमान node coverage PAR1 भर में HiFi sequencing bias दिखाते हैं
  • PAR1 में SINE repeat और non-B DNA motif प्रचुर हैं, और यह विशेषता sequencing gap का कारण हो सकती है
  • T2T-Y भर में non-B DNA motif distribution analysis में Yq के HSat3 और centromere के आसपास की satellite sequence में A-phased repeat, direct repeat और STR अधिक प्रचुर हैं
  • HSat1B में inverted repeat और mirror repeat अधिक प्रचुर हैं
  • PAR region में भी non-B DNA sequence enrichment देखा गया
  • TSPY gene array में G4 और Z-DNA motif प्रचुर हैं
    • हर TSPY copy में TSPY से लगभग 500 bases upstream एक G4 peak है
    • Quadron score 19 से अधिक होने पर stable G4 structure माना जाता है

24 मानव क्रोमोसोम के reference sequence resource

  • शोधकर्ताओं ने T2T-Y को मौजूदा CHM13 genome assembly से जोड़ा और उपलब्ध population variants, clinical variants और functional genomics data को map करके सभी 24 मानव क्रोमोसोम के लिए पूर्ण reference sequence बनाया
  • resource की पूरी सूची marbl/CHM13 से download की जा सकती है
    • T2T-CHM13v2.0, T2T-CHM13+Y assembly
    • reference analysis set
    • gene annotation, repeat annotation, epigenetic profiles
    • 1KGP और SGDP variant-calling results
    • gnomAD, ClinVar, GWAS, dbSNP datasets
  • assembly NCBI और EBI पर भी उपलब्ध है, और GenBank accession GCA_009914755.4 है
  • annotation और संबंधित resources UCSC Genome Browser के hs1, Ensembl Genome Browser के T2T-CHM13v2.0, और NCBI data-hub में भी देखे जा सकते हैं
  • संभावित assembly issues marbl/CHM13-issues पर देखे और track किए जा सकते हैं

सार्वजनिक analysis data और code

  • 1KGP और SGDP short-read alignment तथा variant call AnVIL workspace में उपलब्ध हैं
  • Gerton lab का original data Stowers Original Data Repository से access किया जा सकता है
  • शोध में उपयोग किया गया sequencing data Supplementary Table 1 में सूचीबद्ध है
  • data analysis और visualization के लिए विकसित custom code GitHub और Zenodo पर सार्वजनिक है
  • इस्तेमाल किए गए software और parameters Supplementary Methods में अतिरिक्त विवरणों के साथ बताए गए हैं

1 टिप्पणियां

 
GN⁺ 2023-08-26
Hacker News की टिप्पणियां
  • जो लोग पुरानी मानव जीनोम डिकोडिंग रेस को याद नहीं करते, उनके लिए जोड़ दूं कि उस समय सबसे आगे चल रहे प्रतिस्पर्धी Celera Genomics और Human Genome Project थे
    Craig Venter के नेतृत्व वाली Celera ने घोषणा की थी कि उसने डिकोडिंग पूरी कर ली है, लेकिन असल में उसने जगह-जगह से छोटे नमूने लेकर सांख्यिकीय रूप से जीनोम मॉडल असेंबल करने वाली shotgun method का इस्तेमाल किया था, और करीब 5 साल बाद यह माना कि उसने पूरा जीनोम डिकोड नहीं किया था
    संदर्भ: https://www.technologyreview.com/2007/09/04/223919/craig-ven...

    • Shotgun sequencing, दूसरे Human Genome Project द्वारा इस्तेमाल की जा रही पारंपरिक chromosome walking से खराब नहीं थी, और दोनों ही सचमुच पूरी sequence नहीं बना पाए थे
      उस समय shotgun sequencing की “shortcut” कहकर आलोचना हुई थी, लेकिन अब chromosome walking गायब हो चुकी है और shotgun standard बन गई है
      अगर इसे कोई बदलेगा तो वह Oxford Nanopore जैसी long-read technology होगी, लेकिन उसमें भी अभी data assembly की जरूरत पड़ती है और अभी यह end-to-end जुड़ी हुई sequence सीधे पाने के स्तर पर नहीं है
    • HGP ने भी scaffold-आधारित contig assembly का इस्तेमाल किया था, इसलिए वह भी complete sequence नहीं बना पाया, और दोनों समूहों ने मानो संघर्षविराम करते हुए “पहला draft” पूरा होने की घोषणा की थी
      35 साल पहले: https://www.nytimes.com/1987/12/13/magazine/the-genome-proje...
      33 साल पहले: https://www.nytimes.com/1990/06/05/science/great-15-year-pro...
      29 साल पहले, प्रतिस्पर्धा तेज हुई: https://www.nytimes.com/1994/02/22/science/scientist-at-work...
      24 साल पहले, प्रतिस्पर्धा जारी: https://www.nytimes.com/1999/03/23/science/who-ll-sequence-h...
      23 साल पहले, draft पूरा: https://archive.nytimes.com/www.nytimes.com/library/national...
      20 साल पहले: https://www.nytimes.com/2003/04/15/science/once-again-scient...
      2 साल पहले: https://archive.nytimes.com/www.nytimes.com/library/national...
      Celera का shotgun approach मुश्किल था, क्योंकि टुकड़ों को असेंबल करने के लिए भारी computing power और sophisticated algorithms की जरूरत थी; final assembly computation, algorithm और data के लिए 64GB shared memory मांगता था, इसलिए इसे Compaq के AlphaServer GS160 पर चलाया गया था
      उस समय GS160 एक विशाल UNIX machine थी, और कई machines के बीच integrated I/O/file system के साथ इसे tightly cluster किया जा सकता था
      Shotgun assembly के प्रमुख लेखक Gene Myers थे, जिन्होंने पहले BLAST बनाया था और Udi Manber के साथ suffix array की अवधारणा दी थी
      सार्वजनिक project में भी समस्याएं थीं, क्योंकि कई teams manual और academia-style approach पर अड़ी हुई थीं; Eric Lander ने इसे industrial process में बदला और आगे चलकर Boston के MIT/Harvard private research institute, Broad Institute, का संचालन किया
      आज हर दिन petabyte-scale sequence data बनता है और cloud में store होता है, और genome मानव research का foundational tool बन गया है, लेकिन complex phenotypes को समझने की इसकी क्षमता अभी पूरी तरह सामने नहीं आई है
    • मुझे याद है कि उस समय बहस का मुख्य मुद्दा यह था कि Celera को sequences assemble करने के लिए NIH/International Human Genome Project द्वारा सार्वजनिक की गई जानकारी चाहिए थी, लेकिन वह अपने results private रख रहा था और जानकारी के public domain में आने से पहले intellectual property rights हासिल करने की कोशिश कर रहा था
    • यह आकलन अनावश्यक रूप से नकारात्मक लगता है
      Celera ने जो किया उसमें value थी, और कम-से-कम मेरी छाप में, उन्होंने यह छिपाया भी नहीं कि उन्होंने क्या किया था
      इसे “statistical trick” कहने के बजाय innovation कहना ज्यादा सही होगा
  • हर इंसान की genetic बनावट अलग होती है, इसलिए यह जानने की जिज्ञासा है कि इंसानी genome को पूरी तरह decode कर लिया कहने का ठीक-ठीक मतलब क्या है
    क्या हर व्यक्ति के DNA/RNA का base sequence अलग नहीं होता?

    • सार्वजनिक Human Genome Project ने कई लोगों का उपयोग किया था, लेकिन sequence library का अधिकतर हिस्सा New York Buffalo के एक व्यक्ति से आया था, और Celera ने भी कई लोगों को इस्तेमाल किया, पर अधिकतर Venter का genome था
      https://www.nytimes.com/2002/04/27/us/scientist-reveals-secr...
      मेरी जानकारी में हाल के projects ने व्यक्तियों के अधिक व्यापक समूह का उपयोग किया है
      कुछ projects कई व्यक्तियों को मिलाकर साथ में decode करते हैं, और कुछ projects हर व्यक्ति को अलग-अलग decode करते हैं
      इंसानों के बीच बड़े पैमाने की संरचना बहुत मिलती-जुलती है, और व्यक्तिगत variations को model करने के refined तरीके आ गए हैं, इसलिए यह बड़ी समस्या नहीं है
      reference sequence के भीतर alternatives दिखाने वाली graph structure https://www.biomedcentral.com/collections/graphgenomes में समझाई गई है, और इसमें केवल single-base differences ही नहीं, बल्कि बड़े deletions, rearrangements, inversions जैसे अधिक जटिल variations भी शामिल हो सकते हैं
    • असल में “human genome” के बजाय “एक human genome” कहना ज्यादा सही होगा
      reference genome genomics के Rosetta Stone की तरह है—दूसरे व्यक्तियों के DNA/RNA sequences को reference से align करके समझने और तुलना करने का आधार
      यह perfect नहीं है, इसलिए reference में missing regions या बहुत variable DNA regions हो सकते हैं
      Human Pangenome Reference Consortium(HPRC) https://humanpangenome.org/ का लक्ष्य इस समस्या को हल करने के लिए विविध populations के व्यक्तियों को decode करना है, और population-wide data का विश्लेषण करने के लिए नए computational models भी विकसित किए जा रहे हैं
    • इसका मतलब है कि एक खास Y chromosome का complete sequence मिला है, और उसे “reference” chromosome माना जा रहा है
      बाकी chromosomes पर भी इसी तरह का तरीका लागू किया गया था
    • मुझे भी यह हमेशा ठीक से समझ नहीं आया
      अगर genome ढेर सारे [ATCG]+ megabytes है, तो उस sequence को रखने से हमें क्या पता चलता है, यह सोचता हूं
      क्या बस उसे देखकर “अच्छा, ...ATGCTACGACTACGACTAGCG... दिलचस्प है” कहते हैं?
    • जिस concept की अभी बात हो रही है उसे pangenome assembly कहते हैं
      इस साल की शुरुआत में Guarracino और Garrison के Nature paper सहित कुछ चर्चित papers आए थे
      pangenome आम तौर पर किसी species के सैकड़ों या उससे अधिक genomes/haplotypes को जोड़ने वाला complex graph model होता है, और conceptually इसे species से आगे या किसी एक व्यक्ति के अंदर की cells, जैसे cancer pangenome, तक भी बढ़ाया जा सकता है
      एक idealized human pangenome graph में हर व्यक्ति को हर autosome पर दो strands, और X·Y chromosomes तथा mitochondrial genome से गुजरने वाले strands के रूप में दिखाया जाता है
  • मेरी समझ में gene sequencing कठिन होने की वजह यह है कि ज्यादातर तरीके लंबे gene sequence को पहले randomly टुकड़ों में बांटते हैं और फिर हर टुकड़े को अलग से decode करते हैं
    उन टुकड़ों को फिर सही order में लगाना पड़ता है तभी पूरा genome बनता है; टुकड़ों के बीच overlap होने से यह संभव तो है, लेकिन अगर repeat regions हों तो सिर्फ overlap के आधार पर उन्हें सही-सही जोड़ना मुश्किल होता है
    Nanopore नाम की एक नई technique भी है, जिसमें DNA को सचमुच एक छोटे pore से गुजारा जाता है और pore के अंदर base pair के हिसाब से electrical properties बदलती हैं
    हालांकि sequence के आधार पर deterministic तरीके से errors होने की संभावना रहती है, और पूरा paper देख नहीं पा रहा हूं इसलिए यहां उन्होंने ठीक-ठीक क्या किया, यह नहीं जानता, लेकिन मैंने सुना है कि दोनों approaches को combine किया जाता है

    • यह मुख्य रूप से PacBio HiFi reads पर निर्भर था, और मेरे हिसाब से यह technology genomics में कम आंकी गई revolutionary technology है
      इसके बाद Nanopore sequencing से HiFi contigs को जोड़कर chromosome के सचमुच कठिन regions को cover किया गया
      जैसा मैंने सही समझा है, modern large-scale sequencing पूरी तरह shotgun sequencing है
      DNA को randomly तोड़ा जाता है, हर टुकड़े को decode किया जाता है, और फिर individual pieces यानी reads को genome assembler से assemble किया जाता है
  • human genome records को लेकर मेरे मन में हमेशा एक “बेवकूफाना सवाल” रहा है
    हम सबका DNA अलग है, तो “human genome” क्या average DNA जैसा कुछ है, sample के तौर पर लिए गए किसी व्यक्ति का DNA है, या फिर हम सबमें common चीजों की रूपरेखा है?

    • यहां बात एक reference genome की है
      इंसानों के बीच differences 3 billion bases में से कुछ million bases भर हैं, यानी relatively छोटे
      historical तौर पर reference genome कई व्यक्तियों के average/mosaic के करीब था, और इसकी कमियां साफ हैं, लेकिन reads को आम तौर पर सही स्थान पर रखने और test किए जा रहे genome को unique बनाने वाले differences यानी variants को call करने के लिए यह पर्याप्त था
      latest end-to-end T2T reference लंबी-read technology से मिली नई जानकारी की वजह से Utah के व्यक्ति HG002 पर पूरी तरह आधारित है
    • इस मामले में यह एक cell line से आया एक haplotype है
      अगर genome का population model चाहिए, तो pangenome चाहिए
      “pangenome graph”, “variation graph”, human pangenome project देख सकते हैं
  • यह खबर अभी की नहीं, बल्कि पिछले साल दिसंबर के हिसाब से होनी चाहिए
    T2T team ने पिछले दिसंबर में preprint [1] निकाला और मार्च में data [2] जारी किया, लेकिन peer review process के कारण अब जाकर Nature में आधिकारिक रूप से publish हुआ
    publication schedule सचमुच धीमा हो सकता है, और interested scientists इसे पहले से जानते हैं और इस assembly पर काम कर रहे हैं, ऐसे में formal publication का क्या मतलब है, यह सवाल उठता है
    [1] https://www.biorxiv.org/content/10.1101/2022.12.01.518724v1....
    [2] https://github.com/marbl/CHM13

    • इस context में press release का मतलब, मेरे हिसाब से, उस विषय के scientists नहीं बल्कि आम जनता तक खबर पहुंचाना है
  • यह “चलता हुआ keyboard driver मौजूद है” के ज़्यादा करीब है, या “standard 104-key US QWERTY layout की सभी 104 keys की पहचान कर ली गई है” के?

    • यह अब keyboard बनाने में इस्तेमाल हुई CAD file के raw data के हाथ लगने जैसा है
      कुछ CNC commands समझ में आती हैं, लेकिन control mechanism या क्रम की अभी अच्छी समझ नहीं है
      कभी न कभी keys की पहचान हो जाएगी, लेकिन driver से अभी बहुत दूर हैं, और उससे भी ज़्यादा अहम बात, हर key क्या करती है, उससे भी अभी दूर हैं
      बस इतना पता चला है कि raw data के कुछ खास bits बदलने पर keyboard दिलचस्प तरीकों से खराब हो जाता है
    • अब तक हम 87-key QWERTY इस्तेमाल कर रहे थे, और अब numeric keypad भी मिल गया है—यह उससे ज़्यादा मिलता-जुलता लगता है
  • यह काफ़ी बड़ी घटना है
    इसका मतलब है कि अब सभी 24 chromosomes पूरी तरह decode हो चुके हैं, और abstract में लिखे अनुसार Y chromosome अपनी विशेषताओं के कारण अब तक decode करना मुश्किल था

    • मुझे लगा था Human Genome Project 2003 में खत्म हो गया था, लेकिन फिर देखने पर पता चला कि उस समय “complete” का मतलब 92% था
      फिर 2022 में यह खत्म हुआ, और अब कहा जा रहा है कि यह फिर खत्म हुआ
      सोच रहा/रही हूँ कि आगे भी “फिर से complete” की ओर कोई बाकी milestones हैं क्या
      क्या Y chromosome को अब तक सचमुच exception माना जाता था?
    • जानना चाहता/चाहती हूँ कि Y chromosome को ज़्यादा कठिन बनाने वाली चीज़ें क्या हैं
    • यहाँ आम लोगों की समझ के हिसाब से “पूरी तरह decode” का मतलब क्या है, यह जानना चाहता/चाहती हूँ
  • थोड़ा अलग विषय है, लेकिन बहुत रोचक और शिक्षाप्रद किताब के तौर पर Steve Jones की Y - The Descent of Man की ज़ोरदार सिफ़ारिश करता/करती हूँ
    ज़्यादा chromosomes के map और decode होते देखना उत्साहजनक है
    high-school level biology knowledge के साथ पूछूँ तो, genes, gene expression और interactions में क्या हम correlation से आगे बढ़कर definitive understanding तक पहुँच गए हैं?
    “blue eyes” को उदाहरण लें तो [1] हमें पता है कि OCA2 brown/blue eye color में शामिल है, लेकिन क्या हम भरोसे से कह सकते हैं कि बाकी 20,000 genes बिल्कुल शामिल नहीं हैं या ज़रूरी नहीं हैं?
    आम आदमी की तरह अनुमान लगाऊँ तो blue eyes पाने के लिए कई genes का साथ-साथ on होना, activate होना या मौजूद होना ज़रूरी लगता है, और यह किसी एक location पर simple on/off से ज़्यादा recipe जैसा दिखता है
    [0] https://www.goodreads.com/work/editions/436071-y-the-descent...
    [1] https://www.nature.com/articles/s41433-021-01749-x

    • eye color सूक्ष्म विषय है
      समस्या यहीं से शुरू होती है कि blue eyes को define कैसे किया जाए
      यह कोई एक phenotype नहीं है, बल्कि blue eyes की कई ranges हैं, और उनके फर्क लोगों के बीच काफ़ी छोटे variations से जुड़े होते हैं
      आपने जो paper [1] link किया है वह काफ़ी अच्छा है, लेकिन उसे पूरी तरह समझने में अच्छा-खासा समय लगेगा
    • नज़रिए के हिसाब से देखा जाए तो blue eyes के लिए तरह-तरह के genes की ज़रूरत मानी जा सकती है
      आखिर blue eyes होने के लिए आँखें होनी चाहिए, और color देखने के लिए आँखें खोलने वाली कई व्यवस्थाएँ भी चाहिए
    • human genetics बहुत जटिल है और हम इसे अभी पूरी तरह नहीं समझ पाए हैं
      उदाहरण के लिए, अपेक्षाकृत हाल ही में epigenetics में बड़ा विकास हुआ है, जो broadly यह study करता है कि DNA खुद बदले बिना cell behavior कैसे बदलता है [1]
      यह environment influence और genetic influence वाले पुराने सवाल को और बारीकी से फिर से पूछने पर मजबूर करता है
      eye color तय करने में कितने chromosomes शामिल हैं, इसे लेकर हम पूरी तरह निश्चित नहीं हैं, लेकिन काफ़ी अच्छे estimates मौजूद हैं
      हालिया estimate के मुताबिक यह लगभग 16 हैं, और OCA2 व HERC2 का असर सबसे बड़ा है, लेकिन कई अन्य genes भी छोटे-छोटे प्रभाव डालते हैं [2]
      उद्धृत paper शानदार है, लेकिन gene regulation, introns और exons जैसे विषयों को भी छूता है, जो standard high-school biology से ज़्यादा college intro/AP Biology के करीब हैं
      अधिक सामान्य तौर पर, genetics में किसी चीज़ को 100% पूरी तरह definitive तरीके से कह पाने के चरण तक हम जल्द पहुँचेंगे, ऐसा मुझे नहीं लगता
      genetics और biology overall बहुत आगे बढ़े हैं, लेकिन human genome की जटिलता को सहज ही कम करके नहीं आँकना चाहिए
      स्पष्ट है कि अभी ऐसी चीज़ें हैं जिन्हें हम नहीं समझते, और कुछ समय तक ऐसा ही रहेगा
      व्यावहारिक रूप से, eye color जैसे simple phenotype पर भी दूसरे genes असर डाल सकते हैं, लेकिन आम तौर पर कुछ genes से ही काफ़ी सटीक estimate लगाया जा सकता है
      उदाहरण के लिए, एक study ने सिर्फ 6 genes से eye color को लगभग 75% accuracy से predict किया [3]
      और भी दिलचस्प बात यह है कि phenotype को प्रभावित करने वाला gene कभी-कभी उस trait को निर्धारित करने वाली genetic information सीधे store नहीं करता
      यानी वह gene trait को सीधे निर्धारित नहीं करता, बल्कि दूसरे genes को प्रभावित करता है, और वे दूसरे genes trait expression में ज़्यादा सीधे तौर पर शामिल होते हैं
      कई genes एक-दूसरे को प्रभावित करते हैं, फिर और genes को प्रभावित करते हैं, और research में environmental व demographic biases तक का ध्यान रखना पड़ता है—इससे दिखता है कि genetics कितनी तेज़ी से जटिल हो जाती है
      [1] https://www.ncbi.nlm.nih.gov/pmc/articles/PMC2791696/
      [2] https://www.nature.com/articles/jhg2010126
      [3] https://doi.org/10.1016/j.cub.2009.01.027
  • यह exciting news है
    अगर आप इस work के applications जानना चाहते हैं, तो यह ACM SIGPLAN keynote देखें: https://youtu.be/JTU3JYp3JYc?si=jOZz611ATQar3Gec
    इससे DNA समझने में मुझे पूरे high-school biology class से ज़्यादा मदद मिली