Guides des molécules
Comment lire une séquence peptidique : codes à une et trois lettres, modifications, amidation
Lire une séquence peptidique : sens N vers C, codes à une et trois lettres, modifications Ac- et -NH2, et calcul de la masse moléculaire.
Une séquence peptidique s’écrit de l’extrémité N-terminale, à gauche, vers l’extrémité C-terminale, à droite, à l’aide des codes d’acides aminés à une ou à trois lettres, toute modification chimique étant notée en préfixe ou en suffixe à l’extrémité concernée. Apprendre à lire une séquence peptidique prend une dizaine de minutes, et c’est le moyen le plus rapide de confronter un flacon à son certificat d’analyse : la séquence code l’identité, prédit la masse moléculaire et explique l’essentiel du comportement d’une molécule en solution. Ce guide présente les deux systèmes de codes, les conventions d’orientation, les notations abrégées de modifications que l’on rencontre réellement sur les étiquettes de recherche, et un calcul complet qui transforme une séquence en une masse moléculaire comparable à celle d’un COA. Tout ce qui suit concerne du matériel de référence de laboratoire.
Orientation : pourquoi le sens N vers C compte
Les acides aminés s’unissent par une liaison peptidique formée entre le groupe carboxyle d’un résidu et le groupe amino du suivant. Cette réaction est orientée : une chaîne possède donc deux extrémités chimiquement distinctes, un groupe amino libre (l’extrémité N-terminale) et un groupe carboxyle libre (l’extrémité C-terminale). Par convention universelle, l’extrémité N-terminale s’écrit en premier. Gly-Glu-Pro et Pro-Glu-Gly sont des molécules différentes de composition et de masse identiques, qu’un spectromètre de masse seul ne distinguera pas ; c’est pourquoi la confirmation d’identité par MS est normalement associée à une séquence déclarée, et non utilisée à sa place.
La numérotation des résidus suit le même sens. Lorsqu’une étiquette indique HGH Fragment 176-191, les nombres désignent des positions comptées depuis l’extrémité N-terminale de la protéine parente de 191 résidus ; le fragment correspond aux 16 résidus occupant ces positions, et non à une séquence conçue séparément.
Comment lire une séquence peptidique : codes à une et trois lettres
Les codes à trois lettres sont lisibles et sans ambiguïté ; ils dominent donc sur les étiquettes de produits et les COA. Les codes à une lettre sont compacts et dominent dans les bases de données, les publications et les bons de commande de synthèse. Les deux décrivent les mêmes vingt résidus protéinogènes.
La leucine et l’isoleucine ont la même masse, car ce sont des isomères de structure. Ce seul fait explique une frustration récurrente en analyse peptidique : la spectrométrie de masse standard ne peut pas distinguer L de I, si bien que leur attribution repose sur le dossier de synthèse et sur le comportement chromatographique plutôt que sur la seule masse.
Lire une étiquette réelle
Le BPC-157 est référencé comme Gly-Glu-Pro-Pro-Pro-Gly-Lys-Pro-Ala-Asp-Asp-Ala-Gly-Leu-Val, soit GEPPPGKPADDAGLV en code à une lettre. Quinze résidus, d’où le terme « pentadécapeptide ». Trois prolines consécutives près de l’extrémité N-terminale imposent un coude rigide à la chaîne, et les deux aspartates adjacents portent une charge négative à pH neutre — deux faits structuraux que l’on lit directement dans la séquence, et qui influent tous deux sur la solubilité.
Notations abrégées des modifications
La plupart des peptides de recherche ne sont pas de simples chaînes non modifiées. La notation est cohérente dès qu’on la connaît.
- Ac- à l’extrémité gauche signifie acétylation N-terminale : le groupe amino libre est coiffé d’un groupe acétyle, ce qui ajoute 42.04 Da et supprime une charge positive. Le TB-500 s’écrit Ac-Leu-Lys-Lys-Thr-Glu-Thr-Gln, soit Ac-LKKTETQ.
- -NH2 à l’extrémité droite signifie amidation C-terminale : le -OH terminal est remplacé par -NH2, ce qui retranche 0.98 Da et supprime une charge négative. De nombreux peptides de signalisation naturels sont amidés in vivo, et l’amide est généralement indispensable à l’activité sur le récepteur — l’ocytocine s’écrit Cys-Tyr-Ile-Gln-Asn-Cys-Pro-Leu-Gly-NH2.
- D- devant un résidu désigne l’énantiomère D, comme le D-Trp du GHRP-6 (His-D-Trp-Ala-Trp-D-Phe-Lys-NH2). Les résidus D ont la même masse que leurs homologues L mais sont de mauvais substrats pour les protéases de mammifères ; ils sont donc insérés délibérément pour ralentir la dégradation.
- Les résidus non standard apparaissent sous leur nom. Aib est l’acide α-aminoisobutyrique, un résidu stabilisateur d’hélice et résistant aux protéases, utilisé dans l’Ipamorelin (Aib-His-D-2-Nal-D-Phe-Lys-NH2) et en position 2 du squelette GLP-1 du sémaglutide et du tirzépatide. 2-Nal désigne la 2-naphtylalanine.
- Les crochets et exposants indiquent des substitutions par rapport à une séquence parente ; par exemple, [D-Ala²] signifie que la position 2 a été remplacée par une D-alanine.
- La cyclisation est représentée par un trait, une notation « cyclo(...) » ou un pont disulfure Cys–Cys déclaré. Les Cys1 et Cys6 de l’ocytocine forment un pont disulfure qui ferme un cycle de six résidus ; cette liaison est sensible à la réduction et constitue un véritable enjeu de stockage.
Exemple chiffré : de la séquence à la masse moléculaire
La masse moléculaire est la somme des masses des résidus plus 18.02 Da pour la molécule d’eau libérée lors de la formation de la chaîne, ajustée ensuite pour les modifications. Deux exemples avec les valeurs du catalogue :
- KPV (Lys-Pro-Val). 128.17 + 97.12 + 99.13 = 324.42. Ajoutez 18.02 → 342.44 Da. Le catalogue indique 342.43 ; l’écart de 0.01 provient de l’arrondi de la table des résidus.
- Epitalon (Ala-Glu-Asp-Gly, AEDG). 71.08 + 129.12 + 115.09 + 57.05 = 372.34. Ajoutez 18.02 → 390.36 Da, pour 390.35 au catalogue.
- Ajouter une modification. Une version acétylée et amidée du même tétrapeptide pèserait 390.36 + 42.04 − 0.98 = 431.42 Da.
Une concordance à environ 0.1 % près est le résultat attendu. Un écart de 18 Da signifie généralement que le terme de l’eau a été oublié ; 42 Da, qu’un groupe acétyle a été ignoré ; 1 Da, qu’un amide a été omis. Une fois la masse moléculaire fiable établie, vous pouvez convertir masse et moles pour la préparation de tampons — les calculs sont détaillés dans masse moléculaire, moles et molarité ainsi que dans le calculateur de molarité.
Séquences sur un COA et séquences au catalogue
Une fiche catalogue indique la séquence visée. Un COA rapporte ce qui a été mesuré : une masse monoisotopique ou moyenne observée par MS, et un taux de pureté par HPLC en phase inverse. Aucune de ces techniques ne lit la séquence résidu par résidu, sauf si des données de fragmentation MS/MS sont fournies, ce qui est rare sur les certificats commerciaux courants. Considérez la séquence déclarée comme la déclaration du fabricant et la masse mesurée comme sa vérification.
Erreurs de lecture courantes
- Lire de C vers N. Inverser une séquence produit une molécule différente (un rétro-peptide) de même masse. Vérifiez toujours que le résidu le plus à gauche est l’extrémité N-terminale.
- Considérer la forme saline comme faisant partie de la séquence. Les contre-ions trifluoroacétate ou acétate ne sont pas des résidus ; ils ajoutent de la masse au contenu du flacon mais pas au peptide. C’est la raison habituelle pour laquelle une quantité de poudre pesée contient moins de peptide que ne le laisse supposer la masse indiquée, et c’est pourquoi la teneur en sel de TFA doit figurer sur le COA.
- Supposer que la numérotation d’un fragment correspond à sa longueur. « 176-191 » représente 16 résidus, pas 191.
- Ignorer l’amide. Une séquence active uniquement sous sa forme amidée est un réactif de recherche différent de la version acide libre, même si les deux ne diffèrent que d’un dalton.
- Confondre mélanges et séquences uniques. Un flacon co-formulé comme le KLOW Blend contient quatre séquences et n’a pas de masse moléculaire unique ; voir mélanges vs flacons individuels.
Lorsque la séquence, la masse moléculaire déclarée et la masse observée par MS concordent, vous disposez d’éléments raisonnables pour considérer que le flacon contient ce qu’indique l’étiquette. En cas de désaccord, la séquence est presque toujours l’endroit le plus rapide pour en comprendre la raison.
Questions
Quelle extrémité d’une séquence peptidique s’écrit en premier ?
L’extrémité N-terminale — celle qui porte le groupe amino libre — s’écrit toujours à gauche, et l’extrémité C-terminale à droite. C’est une convention universelle dans les catalogues, les certificats d’analyse et la littérature. Inverser l’ordre décrit une molécule différente de même masse : l’orientation n’est donc pas un détail cosmétique.
Que signifie -NH2 à la fin d’une séquence peptidique ?
Il indique une amidation C-terminale : le -OH du carboxyle terminal a été remplacé par un amide -NH2. Cette modification retranche environ 0.98 Da et supprime une charge négative. De nombreux peptides de signalisation sécrétés naturellement sont amidés in vivo, et l’activité sur le récepteur dans les essais publiés est souvent perdue en l’absence de l’amide ; les formes acide libre et amidée sont donc traitées comme des réactifs distincts.
Pourquoi certaines séquences contiennent-elles des acides aminés D ?
Les énantiomères D ont une masse identique à celle de leurs homologues L, mais sont de mauvais substrats pour la plupart des protéases de mammifères. Les chimistes de synthèse les insèrent aux positions sensibles au clivage afin de ralentir la dégradation enzymatique dans les matrices biologiques. Le GHRP-6, qui s’écrit His-D-Trp-Ala-Trp-D-Phe-Lys-NH2, en contient deux.
Un spectromètre de masse peut-il me donner la séquence ?
Pas à partir d’une simple mesure de masse. Un résultat de MS de routine confirme que la masse totale correspond à la valeur attendue ; il ne peut distinguer la leucine de l’isoleucine, ni une séquence de sa séquence inversée, car celles-ci ont la même masse. L’information de séquence au niveau des résidus nécessite une fragmentation MS/MS, qui ne figure généralement pas sur les certificats d’analyse commerciaux.
Comment calculer la masse moléculaire à partir d’une séquence ?
Additionnez les masses moyennes des résidus de chaque acide aminé de la chaîne, ajoutez 18.02 Da pour l’eau libérée lors de la formation des liaisons, puis ajustez pour les modifications : +42.04 pour un acétyle N-terminal, −0.98 pour un amide C-terminal, −2.02 pour chaque pont disulfure. Pour l’Epitalon (Ala-Glu-Asp-Gly), la somme est 71.08 + 129.12 + 115.09 + 57.05 = 372.34, plus 18.02 = 390.36 Da.
Pourquoi la masse que j’ai calculée diffère-t-elle légèrement de celle du catalogue ?
Les petits écarts de quelques centièmes de dalton proviennent de l’arrondi des tables de masses de résidus, ou du mélange de valeurs moyennes et monoisotopiques. Des écarts d’exactement 18, 42 ou 1 Da signalent respectivement un terme d’eau oublié, un groupe acétyle non pris en compte ou un amide omis. Des écarts plus importants signifient généralement que le sel du contre-ion a été inclus dans l’une des valeurs et pas dans l’autre.
Les mélanges ont-ils une séquence unique ?
Non. Un flacon co-formulé, comme une préparation KLOW ou Wolverine, contient plusieurs séquences distinctes et donc plusieurs masses moléculaires. Son certificat d’analyse doit indiquer chaque composant séparément, et les calculs de molarité doivent être effectués composant par composant, à partir de la masse déclarée de chacun dans le flacon.