BookTranslator
BookTranslator

Jak przetłumaczyć plik SRT bez zmieniania znaczników czasu

Przetłumacz tekst napisów, blokując numery kwestii i kody czasowe, a następnie zweryfikuj kolejność, kodowanie i odtwarzanie przed dostarczeniem pliku.

BookTranslator

BookTranslator Team

7 min read

Szybka odpowiedź: przetłumacz tekst kwestii, zablokuj identyfikatory i kody czasowe

Plik SRT jest plikiem danych z synchronizacją czasową, a nie transkrypcją z ozdobnymi znacznikami czasu. Tłumacz wyłącznie tekst napisów. Zachowaj każdy numer kwestii, znacznik czasu, pustą linię oddzielającą oraz obsługiwany tag formatowania na swoim miejscu, a następnie porównaj strukturę kwestii w źródle i tłumaczeniu przed obejrzeniem wideo.

Aby pracować w sposób uwzględniający strukturę pliku, prześlij oryginalny plik do SRT Translator, zamiast wklejać napisy do nieustrukturyzowanego pola tekstowego. Świadomość struktury pliku zmniejsza ryzyko uszkodzenia formatu, ale nadal należy zweryfikować wynik względem źródła i wideo.

Nieoczywista zasada jest taka: zachowanie kodów czasowych jest konieczne, ale niewystarczające. Docelowa kwestia może zachować dokładnie te same znaczniki czasu i nadal być błędna, jeśli przetłumaczone zdanie jest zbyt długie, by je przeczytać, łamie się w niewłaściwym miejscu albo odnosi się do mówcy, który jeszcze się nie pojawił.

Jak jest zbudowany plik SRT

Typowa kwestia składa się z czterech części:

17
00:00:41,500 --> 00:00:44,200
<i>MAYA:</i> The total is €1,249.50.

  1. 17 to numer kwestii.
  2. 00:00:41,500 to czas rozpoczęcia.
  3. 00:00:44,200 to czas zakończenia.
  4. Pozostała linia lub linie to wyświetlany tekst.

SRT zwykle używa przecinka między sekundami a milisekundami oraz --> między początkiem a końcem. Pusta linia oddziela jedną kwestię od następnej. Niektóre odtwarzacze tolerują odstępstwa; rzetelny proces tłumaczenia nie powinien opierać się na tej tolerancji.

Pobierz syntetyczny test obciążeniowy tłumaczenia SRT. Zawiera dialogi, kursywę, etykietę mówcy, datę, walutę, tekst CJK, arabski, cyrylicę oraz łacińskie znaki diakrytyczne. Treść jest fikcyjna, więc można jej bezpiecznie używać do testów parsera i kodowania.

Dlaczego tłumaczenie metodą kopiuj-wklej psuje pliki SRT

Ogólne procesy pracy z tekstem mogą pomylić strukturę z treścią. Typowe błędy obejmują:

  • tłumaczenie lub zmianę numeracji identyfikatorów kwestii;
  • zmianę separatora znaczników czasu albo przecinka dziesiętnego;
  • łączenie dwóch krótkich kwestii w jeden akapit;
  • usuwanie powtórzonej albo pozornie pustej kwestii;
  • zwracanie pliku otoczonego znacznikami Markdown;
  • przepisywanie etykiet mówców jako zwykłej prozy;
  • usuwanie tagów <i> albo generowanie nieobsługiwanego formatowania rich text;
  • zastępowanie pustych separatorów kwestii zawiniętymi liniami.

Nawet językowo dobre tłumaczenie jest bezużyteczne, jeśli odtwarzacz nie potrafi już sparsować pliku.

Przepływ pracy krok po kroku przy tłumaczeniu

1. Zachowaj oryginał

Pozostaw źródłowy plik SRT bez zmian. Pracuj na kopii oznaczonej językiem, na przykład interview.en.srtinterview.es.srt.

2. Potwierdź, że źródło daje się sparsować

Otwórz plik źródłowy w edytorze napisów albo odtwarzaczu przed rozpoczęciem tłumaczenia. Jeśli źródło już zawiera nakładające się kody czasowe, brakujące separatory albo niewłaściwe przesunięcie względem wideo, najpierw napraw te wady albo je udokumentuj.

3. Wykryj kodowanie

Używaj UTF-8 dla wielojęzycznego wyniku, chyba że specyfikacja dostarczenia wyraźnie wymaga czegoś innego. Wytyczne YouTube dotyczące transkrypcji mówią, że pliki transkrypcji w językach innych niż angielski powinny być zakodowane w UTF-8, co jest rozsądnym punktem wyjścia dla międzynarodowych plików napisów (YouTube Help).

4. Zamroź pola strukturalne

Traktuj numery kwestii i linie ze znacznikami czasu jako treść chronioną. Jeśli narzędzie nie potrafi ich zablokować, tłumacz małymi partiami i weryfikuj po każdej partii.

5. Tłumacz całe kwestie z kontekstem sąsiednich

Tłumacz wyświetlany tekst, ale zapewnij kontekst poprzedniej i następnej kwestii. Napisy bardzo często dzielą jedno zdanie na kilka kwestii; tłumaczenie w izolacji może prowadzić do niespójnych zmian czasu, zaimków albo szyku wyrazów.

6. Dostosuj segmentację do języka docelowego

Zachowaj czas kwestii, chyba że masz uprawnienie do ponownego zsynchronizowania, ale dostosuj podział wierszy w obrębie kwestii w tłumaczeniu. Łam w naturalnych miejscach fraz, a nie po rodzajnikach, przyimkach, nazwach własnych ani ściśle powiązanych frazach czasownikowych.

7. Uruchom walidację strukturalną

Porównaj liczbę kwestii, identyfikatory, znaczniki czasu, kolejność, tagi oraz puste separatory w źródle i tłumaczeniu. Zrób to przed recenzją językową, aby recenzenci nie tracili czasu na plik, którego nie da się wczytać.

8. Obejrzyj całą ścieżkę docelowych napisów

Automatyczne kontrole nie powiedzą ci, czy napis pojawia się, zanim mówca zacznie mówić, zasłania istotny tekst na ekranie albo pozostaje czytelny podczas szybkiej wymiany zdań.

Zachowuj podziały linii, kursywę i etykiety mówców

Nie zachowuj źródłowych podziałów linii mechanicznie, gdy składnia języka docelowego się zmienia. Zachowaj kwestię, a potem wybierz czytelny podział linii w języku docelowym.

Na przykład taki podział w źródle jest słaby:

We approved the proposal
after the final review.

Jeśli język docelowy stawia warunek na początku, naturalne łamanie może się przesunąć. Właściwym celem jest grupowanie semantyczne, a nie dopasowanie do źródła piksel po pikselu.

Zachowuj istotną kursywę tylko wtedy, gdy miejsce docelowe ją obsługuje i wymaga jej przewodnik stylu. Konsekwentnie zachowuj etykiety mówców. YouTube zaleca oznaczenia takie jak [music] dla dźwięków oraz >> do identyfikacji mówców w procesach opartych na transkrypcji (YouTube Help); inni klienci mogą wymagać innej konwencji.

Zweryfikuj liczbę kwestii i kolejność znaczników czasu

Użyj tej tabeli niezmienników:

KontrolaOczekiwany wynikBlokujące?
Liczba kwestiiLiczba kwestii w źródle i tłumaczeniu jest zgodnaTak, chyba że zatwierdzone ponowne zsynchronizowanie zmieniło liczbę
Identyfikatory kwestiiTe same unikalne identyfikatory w tej samej kolejnościTak
Tekst znaczników czasuZgodność bajt do bajtu przy zablokowanym czasieTak
Początek przed końcemKażda kwestia ma dodatni czas trwaniaTak
Kolejność sekwencjiBrak przypadkowego skoku wsteczTak
TagiZrównoważone i obsługiwaneZwykle
Widoczny tekstKażda źródłowa kwestia ma celową wersję docelowąTak

Nie używaj rozmiaru pliku jako wskaźnika zastępczego. Rozszerzenie tekstu w tłumaczeniu sprawia, że plik docelowy jest większy; podobna liczba bajtów niczego nie dowodzi.

Sprawdź napisy względem wideo

Przeprowadź przegląd przy normalnej prędkości odtwarzania i uwzględnij te trudne momenty:

  • najszybsze dialogi;
  • dwóch mówców szybko wymieniających się wypowiedziami;
  • nazwy, daty, waluty i jednostki miary;
  • dialog przechodzący przez cięcie sceny;
  • tekst konkurujący z napisami na planszach lub belkach informacyjnych;
  • piosenki, efekty dźwiękowe i głosy spoza kadru;
  • pierwszą i ostatnią kwestię;
  • przynajmniej jedną sekcję zawierającą każdy obsługiwany tag formatowania.

Użyj listy kontrolnej QA tłumaczenia napisów, aby ocenić czytelność i segmentację po walidacji strukturalnej.

Typowe błędy SRT i sposoby naprawy

ObjawPrawdopodobna przyczynaNaprawa
Odtwarzacz odrzuca plikUszkodzona składnia znaczników czasu albo separatorów kwestiiPorównaj pierwszą błędną kwestię ze źródłem
Napisy się rozjeżdżają, mimo że kody czasowe pasująNiewłaściwa ścieżka źródłowa albo edycja wideoDopasuj plik źródłowy do dokładnej wersji wideo
Tekst wyświetla się jako kwadraty albo mojibakeKodowanie albo obsługa czcionkiZapisz jako UTF-8 i przetestuj środowisko odtwarzania
Zdanie pojawia się pod niewłaściwym mówcąPołączenie kwestii albo tłumaczenie bez kontekstuPrzywróć granice kwestii i przejrzyj sąsiednie kwestie
Dwuwierszowe kwestie zamieniają się w ściany tekstuRozszerzenie tekstu docelowegoSkróć, przeformułuj albo uzyskaj zgodę na ponowne zsynchronizowanie
Kursywa pozostaje otwarta w kolejnych kwestiachNiezrównoważone tagiZweryfikuj tagi w każdej kwestii i zamknij je lokalnie

Kiedy nie zachowywać każdego znacznika czasu

Nie obiecuj zachowania znaczników czasu, gdy synchronizacja źródła jest wadliwa, przetłumaczony język wymaga istotnie innej segmentacji albo samo wideo zostało ponownie zmontowane. W takich przypadkach zachowaj źródło jako materiał referencyjny do audytu i utwórz wyraźnie ponownie zsynchronizowaną ścieżkę docelową.

Blokada znaczników czasu jest ograniczeniem tłumaczeniowym, a nie substytutem profesjonalnego opracowania napisów.

FAQ

Czy mogę przetłumaczyć tylko tekst w pliku SRT?

Tak. Przetłumacz linie tekstowe, chroniąc numery kwestii, znaczniki czasu i separatory. Następnie zweryfikuj, że każda kwestia źródłowa nadal ma jedną celową kwestię docelową.

Czy przetłumaczone napisy powinny mieć tę samą liczbę kwestii?

Jeśli synchronizacja czasowa jest zablokowana, tak. Inna liczba to silny sygnał, że kwestie zostały połączone, utracone albo podzielone. Profesjonalny proces ponownego zsynchronizowania może celowo zmienić tę liczbę, ale powinno to zostać udokumentowane.

Czy mogę zmienić podziały linii bez zmiany znaczników czasu?

Tak. Podziały linii są częścią wyświetlanego tekstu, a nie synchronizacji czasowej kwestii. Przenieś je do naturalnych granic fraz w języku docelowym.

Jakiego kodowania powinienem użyć dla przetłumaczonych plików SRT?

UTF-8 jest najbezpieczniejszym domyślnym wyborem dla wielojęzycznego tekstu. Używaj starszego kodowania tylko wtedy, gdy wymaga tego udokumentowany system dostarczania.

Dlaczego moje przetłumaczone SRT wczytuje się, ale nadal wygląda źle?

Parsowanie i oglądanie to dwa różne testy. Plik może być strukturalnie poprawny, a mimo to jego kwestie mogą być zbyt długie, źle podzielone, źle zsynchronizowane z wersją wideo albo nieobsługiwane przez zestaw czcionek odtwarzacza.

Powiązane wpisy