Molecule guides
Jak czytać sekwencję peptydu: kody jednoliterowe i trzyliterowe, modyfikacje, amidacja
Jak czytać sekwencję peptydu: kierunek od N do C, kody jedno- i trzyliterowe, modyfikacje Ac- i -NH2 oraz obliczanie masy cząsteczkowej na podstawie sekwencji.
Sekwencję peptydu zapisuje się od N-końca po lewej stronie do C-końca po prawej, używając jednoliterowych lub trzyliterowych kodów aminokwasów, a wszelkie modyfikacje chemiczne zapisuje się jako przedrostek lub przyrostek przy końcu, którego dotyczą. Nauka czytania sekwencji peptydu zajmuje około dziesięciu minut i jest najszybszym sposobem wstępnej weryfikacji fiolki względem jej certyfikatu analizy: sekwencja koduje tożsamość, pozwala przewidzieć masę cząsteczkową i wyjaśnia większość zachowań cząsteczki w roztworze. Niniejszy przewodnik omawia oba systemy kodów, konwencje kierunku, skróty modyfikacji rzeczywiście spotykane na etykietach produktów badawczych oraz przykład obliczenia, które przekształca sekwencję w masę cząsteczkową możliwą do porównania z COA. Wszystko poniżej dotyczy laboratoryjnego materiału referencyjnego.
Kierunek: dlaczego zapis od N do C ma znaczenie
Aminokwasy łączą się poprzez wiązanie peptydowe tworzone między grupą karboksylową jednej reszty a grupą aminową następnej. Reakcja ta jest kierunkowa, więc łańcuch ma dwa chemicznie odmienne końce: wolną grupę aminową (N-koniec) i wolną grupę karboksylową (C-koniec). Zgodnie z powszechną konwencją N-koniec zapisuje się jako pierwszy. Gly-Glu-Pro i Pro-Glu-Gly to różne cząsteczki o identycznym składzie i identycznej masie, a sam spektrometr mas ich nie rozróżni — dlatego potwierdzenie tożsamości metodą MS zwykle łączy się z deklarowaną sekwencją, zamiast stosować je w jej miejsce.
Numeracja reszt przebiega w tym samym kierunku. Gdy etykieta brzmi HGH Fragment 176-191, liczby odnoszą się do pozycji liczonych od N-końca macierzystego białka o 191 resztach; fragment to 16 reszt zajmujących te pozycje, a nie odrębnie zaprojektowana sekwencja.
Jak czytać sekwencję peptydu: kody jednoliterowe i trzyliterowe
Kody trzyliterowe są czytelne i jednoznaczne, dlatego dominują na etykietach produktów i w COA. Kody jednoliterowe są zwięzłe i dominują w bazach danych, publikacjach i formularzach zamówień syntezy. Oba opisują te same dwadzieścia reszt proteinogennych.
Leucyna i izoleucyna mają tę samą masę, ponieważ są izomerami strukturalnymi. Ten jeden fakt wyjaśnia powracający problem w analityce peptydów: standardowa spektrometria mas nie potrafi odróżnić L od I, więc ich przypisanie opiera się na dokumentacji syntezy i zachowaniu chromatograficznym, a nie na samej masie.
Odczytywanie rzeczywistej etykiety
BPC-157 jest skatalogowany jako Gly-Glu-Pro-Pro-Pro-Gly-Lys-Pro-Ala-Asp-Asp-Ala-Gly-Leu-Val, co w kodzie jednoliterowym daje GEPPPGKPADDAGLV. Piętnaście reszt, stąd "pentadekapeptyd". Trzy kolejne proliny w pobliżu N-końca nadają łańcuchowi sztywne załamanie, a dwa sąsiadujące asparaginiany niosą ładunek ujemny w obojętnym pH — oba fakty strukturalne można odczytać bezpośrednio z sekwencji i oba mają znaczenie dla rozpuszczalności.
Skróty modyfikacji
Większość peptydów badawczych nie jest prostymi, niemodyfikowanymi łańcuchami. Zapis jest spójny, gdy się go pozna.
- Ac- na lewym końcu oznacza N-końcową acetylację: wolna grupa aminowa jest zablokowana grupą acetylową, co dodaje 42.04 Da i usuwa ładunek dodatni. TB-500 zapisuje się jako Ac-Leu-Lys-Lys-Thr-Glu-Thr-Gln, tj. Ac-LKKTETQ.
- -NH2 na prawym końcu oznacza C-końcową amidację: końcowa grupa -OH jest zastąpiona przez -NH2, co odejmuje 0.98 Da i usuwa ładunek ujemny. Wiele naturalnych peptydów sygnałowych jest amidowanych in vivo, a amid jest zwykle niezbędny do aktywności receptorowej — oksytocynę zapisuje się jako Cys-Tyr-Ile-Gln-Asn-Cys-Pro-Leu-Gly-NH2.
- D- przed resztą oznacza enancjomer D, jak D-Trp w GHRP-6 (His-D-Trp-Ala-Trp-D-Phe-Lys-NH2). Reszty D mają tę samą masę co ich odpowiedniki L, ale są słabymi substratami dla proteaz ssaczych, dlatego wprowadza się je celowo, aby spowolnić degradację.
- Reszty niestandardowe podaje się z nazwy. Aib to kwas α-aminoizomasłowy — reszta stabilizująca helisę i odporna na proteazy, stosowana w Ipamorelin (Aib-His-D-2-Nal-D-Phe-Lys-NH2) oraz w pozycji 2 szkieletu GLP-1 w semaglutide i tirzepatide. 2-Nal to 2-naftyloalanina.
- Nawiasy kwadratowe i indeksy górne oznaczają podstawienia względem sekwencji macierzystej, np. [D-Ala²] oznacza, że w pozycji 2 wprowadzono D-alaninę.
- Cyklizację oznacza się linią, zapisem "cyclo(...)" lub wskazanym mostkiem disiarczkowym Cys–Cys. Cys1 i Cys6 oksytocyny tworzą mostek disiarczkowy zamykający pierścień z sześciu reszt; wiązanie to jest wrażliwe na redukcję i stanowi realny czynnik przy przechowywaniu.
Przykład obliczeniowy: od sekwencji do masy cząsteczkowej
Masa cząsteczkowa to suma mas reszt plus 18.02 Da dla cząsteczki wody uwalnianej przy tworzeniu łańcucha, skorygowana następnie o modyfikacje. Dwa przykłady z wykorzystaniem wartości katalogowych:
- KPV (Lys-Pro-Val). 128.17 + 97.12 + 99.13 = 324.42. Dodać 18.02 → 342.44 Da. Katalog podaje 342.43; różnica 0.01 wynika z zaokrągleń w tabeli mas reszt.
- Epitalon (Ala-Glu-Asp-Gly, AEDG). 71.08 + 129.12 + 115.09 + 57.05 = 372.34. Dodać 18.02 → 390.36 Da, wobec katalogowych 390.35.
- Uwzględnienie modyfikacji. Acetylowana i amidowana wersja tego samego tetrapeptydu miałaby 390.36 + 42.04 − 0.98 = 431.42 Da.
Oczekiwanym wynikiem jest zgodność w granicach ok. 0.1%. Rozbieżność 18 Da zwykle oznacza pominięcie składnika wody; 42 Da — pominięcie grupy acetylowej; 1 Da — przeoczenie amidu. Mając wiarygodną masę cząsteczkową, można przeliczać masę na mole przy przygotowaniu buforów — arytmetykę omówiono w artykule o masie cząsteczkowej, molach i molarności oraz w kalkulatorze molarności.
Sekwencje w COA a sekwencje w katalogu
Wpis katalogowy podaje zamierzoną sekwencję. COA podaje to, co zmierzono: obserwowaną masę monoizotopową lub średnią z MS oraz wartość czystości z HPLC w odwróconym układzie faz. Żadna z tych technik nie odczytuje sekwencji reszta po reszcie, chyba że dostarczono dane fragmentacji MS/MS, co w rutynowych certyfikatach komercyjnych jest rzadkie. Deklarowaną sekwencję należy traktować jako oświadczenie producenta, a zmierzoną masę jako jego weryfikację.
Typowe błędy odczytu
- Czytanie od C do N. Odwrócenie sekwencji daje inną cząsteczkę (retropeptyd) o tej samej masie. Zawsze należy potwierdzić, że skrajna lewa reszta to N-koniec.
- Traktowanie formy soli jako części sekwencji. Przeciwjony trifluorooctanowe lub octanowe nie są resztami; zwiększają masę zawartości fiolki, ale nie masę peptydu. To typowy powód, dla którego odważona ilość proszku zawiera mniej peptydu, niż sugeruje masa na etykiecie, i dlatego zawartość soli TFA powinna być podana w COA.
- Zakładanie, że numeracja fragmentu odpowiada jego długości. "176-191" to 16 reszt, a nie 191.
- Pomijanie amidu. Sekwencja aktywna wyłącznie w formie amidowanej jest innym odczynnikiem badawczym niż wersja z wolnym kwasem, mimo że obie różnią się o jeden dalton.
- Mylenie mieszanek z pojedynczymi sekwencjami. Fiolka z koformulacją, taka jak KLOW Blend, zawiera cztery sekwencje i nie ma jednej masy cząsteczkowej; zob. mieszanki a pojedyncze fiolki.
Gdy sekwencja, deklarowana masa cząsteczkowa i obserwowana masa z MS są zgodne, istnieją rozsądne dowody, że fiolka zawiera to, co podaje etykieta. Gdy się różnią, sekwencja jest niemal zawsze najszybszym miejscem, by ustalić przyczynę.
Pytania
Który koniec sekwencji peptydu zapisuje się jako pierwszy?
N-koniec — koniec z wolną grupą aminową — zawsze zapisuje się po lewej stronie, a C-koniec po prawej. Jest to powszechna konwencja stosowana w katalogach, certyfikatach analizy i literaturze. Odwrócenie kolejności opisuje inną cząsteczkę o tej samej masie, więc kierunek nie jest szczegółem kosmetycznym.
Co oznacza -NH2 na końcu sekwencji peptydu?
Oznacza C-końcową amidację: końcowa grupa -OH grupy karboksylowej została zastąpiona amidową -NH2. Zmiana ta odejmuje ok. 0.98 Da i usuwa jeden ładunek ujemny. Wiele naturalnie wydzielanych peptydów sygnałowych jest amidowanych in vivo, a aktywność receptorowa w opublikowanych testach często zanika przy braku amidu, dlatego formy z wolnym kwasem i amidowane traktuje się jako odrębne odczynniki.
Dlaczego niektóre sekwencje zawierają D-aminokwasy?
Enancjomery D mają masę identyczną z odpowiednikami L, ale są słabymi substratami dla większości proteaz ssaczych. Chemicy syntetycy wprowadzają je w pozycjach podatnych na cięcie, aby spowolnić degradację enzymatyczną w matrycach biologicznych. GHRP-6, zapisywany jako His-D-Trp-Ala-Trp-D-Phe-Lys-NH2, zawiera dwie takie reszty.
Czy spektrometr mas może podać sekwencję?
Nie na podstawie prostego pomiaru masy. Rutynowy wynik MS potwierdza, że masa całkowita odpowiada wartości oczekiwanej; nie pozwala odróżnić leucyny od izoleucyny ani sekwencji od jej odwróconego odpowiednika, ponieważ mają one tę samą masę. Informacja o sekwencji na poziomie reszt wymaga fragmentacji MS/MS, która zwykle nie jest ujmowana w komercyjnych certyfikatach analizy.
Jak obliczyć masę cząsteczkową na podstawie sekwencji?
Należy zsumować średnie masy reszt wszystkich aminokwasów w łańcuchu, dodać 18.02 Da za wodę uwalnianą przy tworzeniu wiązań, a następnie uwzględnić modyfikacje: +42.04 za N-końcowy acetyl, −0.98 za C-końcowy amid, −2.02 za każdy mostek disiarczkowy. Dla Epitalon (Ala-Glu-Asp-Gly) suma wynosi 71.08 + 129.12 + 115.09 + 57.05 = 372.34, plus 18.02 = 390.36 Da.
Dlaczego obliczona masa nieznacznie różni się od wartości katalogowej?
Niewielkie różnice rzędu kilku setnych daltona wynikają z zaokrągleń w tabelach mas reszt lub z mieszania wartości średnich i monoizotopowych. Różnice wynoszące dokładnie 18, 42 lub 1 Da wskazują odpowiednio na pominięty składnik wody, nieuwzględnioną grupę acetylową lub przeoczony amid. Większe rozbieżności zwykle oznaczają, że sól przeciwjonu uwzględniono w jednej wartości, a w drugiej nie.
Czy mieszanki mają jedną sekwencję?
Nie. Fiolka z koformulacją, taka jak preparat KLOW lub Wolverine, zawiera kilka odrębnych sekwencji, a zatem kilka mas cząsteczkowych. Jej certyfikat analizy powinien podawać każdy składnik osobno, a obliczenia molarności należy przeprowadzać dla każdego składnika oddzielnie, z wykorzystaniem deklarowanej masy tego składnika w fiolce.