Claude и Gemini в переводе книг: кто справился лучше
В RUVDS сравнили Claude, Gemini и OpenAI-модель на художественном переводе, редактуре и сверке текста. Тесты показали, что у каждой модели есть своя сильная роль, а лучший результат в реальной работе дает не бренд линейки, а проверка на конкретной задаче.
Как устроен BookTrans и зачем в нем три роли
Сравнение провели внутри open-source-конвейера BookTrans, который переводит книгу по этапам: сначала собирает справочник имен и терминов, потом переводит текст кусками, затем редактирует результат и в конце собирает книгу в нужный формат — например, epub или fb2. Такой подход удобен для больших проектов, где важно держать единый стиль и не путаться в именах и терминах.
Важная особенность схемы в том, что редактор не видит оригинал. Это сделано специально: если перед глазами есть английский синтаксис, правка начинает тянуться к нему и приносит в русский текст кальки. Но за такую «слепоту» приходится платить: редактор не всегда понимает, ошибка перед ним в оригинале или в переводе, поэтому спорные места он отправляет человеку на проверку. Для этого в конвейере появилась отдельная роль — сверщик, который видит и оригинал, и перевод, и замечание редактора, а потом решает, что исправлять.
На практике это полезно всем, кто работает с книгами, локализацией, статьями или большими документами. Один ИИ может писать черновик, другой — полировать фразы, третий — проверять спорные фрагменты. Такой разделенный процесс помогает не только ускорить работу, но и снизить риск незаметных фактических ошибок.
Что показали тесты на романе Стивена Бакстера
В качестве полигона взяли главы романа Стивена Бакстера Timelike Infinity из цикла Xeelee Sequence, перевод с английского на русский. Все модели работали по одному и тому же справочнику имен и на одинаковых главах, а качество сравнивали двумя способами: по числу правок от модели-судьи и по ручному чтению рядом с оригиналом.
Главный сюрприз теста — Gemini Flash 3.7 обошла Gemini Pro 3.1, хотя Pro считается более сильной линейкой. В тексте источника отмечено, что Flash оказалась чище по правкам, лучше держала живой русский и при этом работала быстрее и дешевле. Pro, наоборот, чаще тянула кальки и канцелярские конструкции. Авторы связывают это не с названием линейки, а с поколением модели: Flash новее, чем Pro 3.1, и это в тесте оказалось важнее статуса «флагмана».
По ручной оценке у моделей тоже выявились разные сильные стороны. Flash давала точный и живой перевод, Opus лучше всего звучала как русская проза, Sol сильнее всего держалась за оригинал и даже лучше других справлялась с отдельными проблемными местами OCR. Аутсайдером в этой выборке стала Pro: у нее чаще встречались кальки и тяжелый, канцелярский стиль.
Что это значит для работы с ИИ-переводом
Вывод из статьи практичный: выбирать модель по громкому названию линейки нельзя. Для художественного перевода, редактуры и сверки нужно смотреть не на бренд, а на реальный замер в своей задаче. Причем важно отдельно проверять черновой перевод, литературную правку и факт-чекинг — одна и та же модель может быть хороша только в одной из этих ролей.
Это особенно полезно редакторам, переводчикам, маркетологам и командам, которые готовят большие тексты. Если заранее разделить задачи между моделями и проверить их на своем материале, можно сэкономить время на вычитке, быстрее выпускать тексты и реже ловить ошибки, которые потом дорого исправлять вручную. В таких сценариях ИИ-сервис удобен как рабочий конвейер, а не как «магический переводчик на все случаи».