Как проверялось качество. Тест проведён на пяти языках — английском, французском, немецком, испанском и русском (одинаковый бриф, отдельная таблица на каждый язык; дополнительно детекторы обращения: tu/vous, Duzen/Sie, tuteo/usted, ты/вы). Два независимых контура. Первый — механический: детектор AI-штампов (для французской волны — включая tu/vous), ритм предложений, структура, объём, обращение tu/vous, ссылки и валидность HTML. Второй — слепое судейство через Claude Fable 5: статьи каждой волны подавались судье под анонимными номерами в случайном порядке, рубрика по 4 осям (вода, ритм, конкретика, естественность языка). Первый прогон судейства забраковал сам: судья штрафовал за SEO-анкоры, которые прямо требовал бриф, и за «обрывы», оказавшиеся обрезкой текста при подаче. Второй прогон — полные тексты плюс контекст брифа; его баллы и стоят в таблице.
Английский язык
| Показатель | 🥇Claude Opus 5через OpenRouter⚠ водяной знак | 🥈Claude Fable 5через OpenRouter⚠ водяной знак | 🥉Kimi K3через OpenRouter | Kimi K2.5через OpenRouter | DeepSeek v4 Proчерез OpenRouter | Claude Sonnet 5через OpenRouter⚠ водяной знак | Grok 4.6через OpenRouter | Qwen 3.8 Maxчерез OpenRouter | GPT-5.6 Terraчерез Kie.ai | Gemini 3.7 Flashчерез OpenRouter⚠ SynthID-метка | DeepSeek v3.1через OpenRouter | Gemini 3.1 Proчерез OpenRouter⚠ SynthID-метка | GPT-5.6 Solчерез Kie.ai | Qwen 3.5 Plusчерез OpenRouter | DeepSeek v4 Flashчерез OpenRouter | Mistral Largeчерез OpenRouter | Gemini 2.5 Flashчерез OpenRouter⚠ SynthID-метка | Llama 4 Maverickчерез OpenRouter |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Тариф, $ за 1М токенов | 5.00 / 25.00 | 10.00 / 50.00 | 3.00 / 15.00 | 0.45 / 2.25 | 0.40 / 0.79 | 2.00 / 10.00 | 2.00 / 6.00 | 2.00 / 6.00 | кредиты | 0.375 / 1.875 | 0.55 / 1.65 | 2.00 / 12.00 | кредиты | 0.26 / 1.56 | 0.05 / 0.10 | 2.00 / 6.00 | 0.30 / 2.50 | 0.20 / 0.80 |
| Цена за готовую статью | $0.116 | $0.203 | $0.074 | $0.009 | $0.003 | $0.041 | $0.026 | $0.118 | ≈ $0.02 | $0.008 | $0.002 | $0.071 | ≈ $0.03 | $0.004 | $0.0003 | $0.019 | $0.010 | $0.001 |
| Время генерации | 65 с | 50 с | 212 с | 13 с | 100 с | 45 с | 86 с | 329 с | 63 с | 34 с | 131 с | 49 с | ~90 с | 39 с | 23 с | 48 с | 25 с | 105 с |
| Объём (бриф: 1200–1600 слов) | 1864 | 1594 | 1837 | 1523 | 2024 | 1641 | 1990 | 1355 | 2121 | 1955 | 1404 | 1781 | 2047 | 1903 | 1327 | 1597 | 2519 | 762 |
| Соблюдение ТЗ | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | 1 ссылка из 2 | полное | 5 ссылок вместо 2 | 3 ссылки, markdown | перебор объёма | структура есть |
| Сильная сторона | вода 9/10 — чистейший текст теста | конкретика и язык 9/10 | живой язык, полный бриф | 13 секунд и конкретика 9/10 | сильная конкретика; на EN проблемы «ты» нет | ровно и по делу | конкретная фактура | плотный текст без воды | конкретика 9/10 | конкретика 9/10 | дёшево и в объёме | аккуратная структура | язык 8/10 | дёшево | цена и конкретика | приличный язык | скорость | быстро |
| Слабость | дорого | самая дорогая; судьёй была она сама | медленная, reasoning платный | вторая таблица сверх брифа | слегка раздут | без ярких плюсов | перебор объёма | 17к(!) reasoning-токенов, не отключить | раздут сверх брифа | вода в связках | суховатые переходы | канцелярит, дорого для результата | снова провалила обязательную ссылку (−10) | водянистые связки | самовольные лишние ссылки (−10) | лишняя ссылка + markdown (−13); 2512-версия в rate-limit | вода и раздутость | вдвое короче брифа, поверхностно |
| Слепая оценка Fable 5 (0–100) | 88 | 88 | 86 | 85 | 83 | 80 | 80 | 78 | 78 | 74 | 70 | 70 | 79 | 68 | 74 | 75 | 60 | 46 |
| Балл (итоговый) | 88Качество | 88 | 86 | 85Цена/качество | 83 | 80 | 80 | 78 | 78 | 74 | 70 | 70 | 69 | 68 | 64 | 62 | 60 | 46 |
Таблица прокручивается вправо на узких экранах. Первая колонка закреплена.
Французский язык
| Показатель | 🥇Kimi K3через OpenRouter | 🥈Claude Fable 5через OpenRouter⚠ водяной знак | 🥉Qwen 3.8 Maxчерез OpenRouter | Grok 4.6через OpenRouter | Claude Opus 5через OpenRouter⚠ водяной знак | DeepSeek v4 Flashчерез OpenRouter | Kimi K2.5через OpenRouter | Gemini 3.7 Flashчерез OpenRouter⚠ SynthID-метка | GPT-5.6 Terraчерез Kie.ai | Claude Sonnet 5через OpenRouter⚠ водяной знак | Gemini 3.1 Proчерез OpenRouter⚠ SynthID-метка | Qwen 3.5 Plusчерез OpenRouter | GPT-5.6 Solчерез Kie.ai | Mistral Large 2512через OpenRouter | DeepSeek v3.1через OpenRouter | Gemini 2.5 Flashчерез OpenRouter⚠ SynthID-метка | DeepSeek v4 Proчерез OpenRouter | Llama 4 Maverickчерез OpenRouter |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Тариф, $ за 1М токенов | 3.00 / 15.00 | 10.00 / 50.00 | 2.00 / 6.00 | 2.00 / 6.00 | 5.00 / 25.00 | 0.05 / 0.10 | 0.45 / 2.25 | 0.375 / 1.875 | кредиты | 2.00 / 10.00 | 2.00 / 12.00 | 0.26 / 1.56 | кредиты | 0.50 / 1.50 | 0.55 / 1.65 | 0.30 / 2.50 | 0.40 / 0.79 | 0.20 / 0.80 |
| Цена за готовую статью | $0.140 | $0.258 | $0.061 | $0.043 | $0.151 | $0.0004 | $0.009 | $0.010 | ≈ $0.02 | $0.052 | $0.078 | $0.006 | ≈ $0.03 | $0.010 | $0.004 | $0.011 | $0.005 | $0.001 |
| Время генерации | 168 с | 58 с | 188 с | 155 с | 75 с | 64 с | 72 с | 35 с | 63 с | 50 с | 54 с | 49 с | ~90 с | 100 с | 119 с | 37 с | 55 с | 43 с |
| Объём (бриф: 1200–1600 слов) | 1638 | 1675 | 1871 | 2296 | 1920 | 1585 | 1387 | 2053 | 1946 | 1508 | 2319 | 2067 | 1918 | 2655 | 1906 | 2695 | 1698 | 786 |
| Соблюдение ТЗ | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | 1 ссылка из 2 | markdown в заголовке, 2 таблицы | полное | перебор объёма | полное | 7 разделов из 12, нет таблицы ошибок (−10) |
| Сильная сторона | самый живой язык | чистая механика, ровный язык | крепко, без воды | живое интро, конкретная таблица ошибок | точные инструкции, ноль воды | структура 1:1 по брифу, конкретика | конкретика сильнее, чем ждёшь за цену | структура полная | аккуратная структура | компактно и по делу | плотная фактура, без мета-интро | вежливый связный текст | хороший язык | хороший французский | достойно для цены | скорость | конкретные таблицы, реальные примеры | быстро и дёшево |
| Слабость | reasoning-токены — цена гуляет | переплата ×1.7, мета-интро; судьёй была она сама | ~6.7к скрытых токенов, не отключить | перебор объёма, англицизмы | старый год в заголовке, корявый второй анкор | текст проще, чем у v4 Pro | шаблонные вступления, старый год | техно-канцелярит, мета-интро | мета-интро, суховато | мета-интро, расплывчатые данные | канцелярский тон, перебор объёма | водянистое интро, длинные H2 | провалила обязательную ссылку (−10) | «2024», раздут, markdown (−5) | мета-интро, старый год, кривые анкоры | SEO-вода | пишет читателю «ты» — брак для гайдов | половина брифа проигнорирована |
| Скрытые reasoning-токены | есть | 0 | ~6.7к | ~3к | 0 | 0 | отключаются | ~1.7к | настраивается | 0 | ~2.8к | 0 | настраивается | 0 | 0 | 0 | 0 | 0 |
| Слепая оценка Fable 5 (0–100) | 86 | 86 | 82 | 80 | 81 | 76 | 78 | 73 | 72 | 72 | 71 | 69 | 74 | 66 | 63 | 56 | 55 | 40 |
| Балл (итоговый) | 86Качество | 86 | 82 | 80 | 79 | 76Цена/качество | 76 | 73 | 72 | 72 | 71 | 69 | 64 | 61 | 61 | 56 | 55 | 30 |
Таблица прокручивается вправо на узких экранах. Первая колонка закреплена.
Немецкий язык
| Показатель | 🥇Kimi K3через OpenRouter | 🥈Claude Fable 5через OpenRouter⚠ водяной знак | 🥉DeepSeek v4 Proчерез OpenRouter | Gemini 3.1 Proчерез OpenRouter⚠ SynthID-метка | Gemini 3.7 Flashчерез OpenRouter⚠ SynthID-метка | Kimi K2.5через OpenRouter | Claude Opus 5через OpenRouter⚠ водяной знак | Grok 4.6через OpenRouter | GPT-5.6 Solчерез Kie.ai | Claude Sonnet 5через OpenRouter⚠ водяной знак | GPT-5.6 Terraчерез Kie.ai | Qwen 3.8 Maxчерез OpenRouter | DeepSeek v4 Flashчерез OpenRouter | Mistral Large 2512через OpenRouter | DeepSeek v3.1через OpenRouter | Qwen 3.5 Plusчерез OpenRouter | Gemini 2.5 Flashчерез OpenRouter⚠ SynthID-метка | Llama 4 Maverickчерез OpenRouter |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Тариф, $ за 1М токенов | 3.00 / 15.00 | 10.00 / 50.00 | 0.40 / 0.79 | 2.00 / 12.00 | 0.375 / 1.875 | 0.45 / 2.25 | 5.00 / 25.00 | 2.00 / 6.00 | кредиты | 2.00 / 10.00 | кредиты | 2.00 / 6.00 | 0.05 / 0.10 | 0.50 / 1.50 | 0.55 / 1.65 | 0.26 / 1.56 | 0.30 / 2.50 | 0.20 / 0.80 |
| Цена за готовую статью | $0.165 | $0.309 | $0.012 | $0.068 | $0.011 | $0.010 | $0.162 | $0.038 | ≈ $0.03 | $0.051 | ≈ $0.02 | $0.100 | $0.0003 | $0.008 | $0.004 | $0.006 | $0.010 | $0.002 |
| Время генерации | 308 с | 72 с | 75 с | 48 с | 44 с | 41 с | 85 с | 102 с | ~90 с | 49 с | 63 с | 311 с | 46 с | 89 с | 88 с | 49 с | 35 с | 20 с |
| Объём (бриф: 1200–1600 слов) | 1422 | 1570 | 1491 | 1979 | 1878 | 1162 | 1574 | 1986 | 1886 | 1265 | 1935 | 1577 | 1410 | 2401 | 1716 | 1925 | 2140 | 792 |
| Соблюдение ТЗ | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | 7 разделов из 12 | 8 разделов из 12 | полное | структура есть |
| Сильная сторона | немецкий 9/10, живой текст | немецкий 9/10 | Sie-анрede чистая, конкретика 9/10 | лучший результат Google в тесте | немецкий 9/10, конкретика 9/10 | дёшево и крепко | конкретика 9/10 | конкретика 9/10 | на DE впервые обе ссылки на месте | компактно | структура ровная | без воды | цена вне конкуренции | прошёл без штрафов | дёшево | связный текст | скорость | быстро |
| Слабость | медленно, дорогой reasoning | самая дорогая; судьёй была она сама | без ярких минусов | слегка раздут | чуть длиннее брифа | вторая таблица сверх брифа | немецкий суше французского | перебор объёма, немецкий 7/10 | немецкий 7/10 | бледнее старших Claude | конкретика слабее Sol | 13.5к reasoning-токенов, немецкий средний | немецкий 6/10 — калька с английского | вода и раздутость; обе версии в rate-limit | сломал структуру брифа (−10) | сломал структуру (−10), немецкий 6/10 | вода, водянистые связки | вдвое короче брифа, поверхностно |
| Слепая оценка Fable 5 (0–100) | 86 | 85 | 82 | 82 | 81 | 80 | 80 | 79 | 78 | 74 | 73 | 70 | 67 | 60 | 70 | 64 | 52 | 46 |
| Балл (итоговый) | 86Качество | 85 | 82Цена/качество | 82 | 81 | 80 | 80 | 79 | 78 | 74 | 73 | 70 | 67 | 60 | 60 | 54 | 52 | 46 |
Таблица прокручивается вправо на узких экранах. Первая колонка закреплена.
Испанский язык
| Показатель | 🥇Kimi K3через OpenRouter | 🥈Claude Opus 5через OpenRouter⚠ водяной знак | 🥉Claude Fable 5через OpenRouter⚠ водяной знак | DeepSeek v4 Proчерез OpenRouter | DeepSeek v4 Flashчерез OpenRouter | GPT-5.6 Solчерез Kie.ai | Grok 4.6через OpenRouter | Gemini 3.7 Flashчерез OpenRouter⚠ SynthID-метка | Claude Sonnet 5через OpenRouter⚠ водяной знак | GPT-5.6 Terraчерез Kie.ai | Kimi K2.5через OpenRouter | Mistral Large 2512через OpenRouter | Qwen 3.5 Plusчерез OpenRouter | Qwen 3.8 Maxчерез OpenRouter | Gemini 2.5 Flashчерез OpenRouter⚠ SynthID-метка | Gemini 3.1 Proчерез OpenRouter⚠ SynthID-метка | DeepSeek v3.1через OpenRouter | Llama 4 Maverickчерез OpenRouter |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Тариф, $ за 1М токенов | 3.00 / 15.00 | 5.00 / 25.00 | 10.00 / 50.00 | 0.40 / 0.79 | 0.05 / 0.10 | кредиты | 2.00 / 6.00 | 0.375 / 1.875 | 2.00 / 10.00 | кредиты | 0.45 / 2.25 | 0.50 / 1.50 | 0.26 / 1.56 | 2.00 / 6.00 | 0.30 / 2.50 | 2.00 / 12.00 | 0.55 / 1.65 | 0.20 / 0.80 |
| Цена за готовую статью | $0.240 | $0.156 | $0.254 | $0.003 | $0.0003 | ≈ $0.03 | $0.035 | $0.008 | $0.049 | ≈ $0.02 | $0.008 | $0.005 | $0.005 | $0.125 | $0.008 | $0.090 | $0.003 | $0.002 |
| Время генерации | 112 с | 82 с | 62 с | 92 с | 26 с | ~90 с | 87 с | 33 с | 49 с | 63 с | 38 с | 51 с | 43 с | 345 с | 16 с | 63 с | 48 с | 18 с |
| Объём (бриф: 1200–1600 слов) | 1641 | 1902 | 1636 | 1998 | 1525 | 1823 | 1621 | 1999 | 1519 | 1969 | 1240 | 1451 | 1929 | 1371 | 1888 | 2207 | 1631 | 855 |
| Соблюдение ТЗ | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | markdown | полное | полное | полное | полное | 7 разделов из 12 | 10 разделов из 12 |
| Сильная сторона | испанский 9/10 — лучший балл теста | конкретика и язык 9/10 | язык 9/10 | стабильно сильная на ES | лучшая цена/качество ES | лучший результат Sol за весь тест, обе ссылки | конкретика 9/10 | конкретика 9/10 | язык 9/10 | ровно | конкретика 9/10 | компактно | связный текст | без воды | скорость | структура | дёшево | быстро |
| Слабость | дорогой reasoning (10.7к токенов) | дорого | самая дорогая; судьёй была она сама | слегка раздут | без ярких минусов | слегка раздут | платный reasoning | вода в связках | бледнее старших | раздут | испанский 6/10 — слабее других языков | markdown в заголовке (−3) | водянистые связки | конкретика 6/10 — худший её результат; 18к reasoning | вода 4/10 | вода 4/10 — провал после сильного DE | сломал структуру (−10) | вдвое короче, конкретика 3/10 (−10) |
| Слепая оценка Fable 5 (0–100) | 88 | 86 | 86 | 83 | 82 | 82 | 80 | 78 | 78 | 78 | 74 | 74 | 70 | 68 | 60 | 56 | 66 | 36 |
| Балл (итоговый) | 88Качество | 86 | 86 | 83 | 82Цена/качество | 82 | 80 | 78 | 78 | 78 | 74 | 71 | 70 | 68 | 60 | 56 | 56 | 26 |
Таблица прокручивается вправо на узких экранах. Первая колонка закреплена.
Русский язык
| Показатель | 🥇Claude Fable 5через OpenRouter⚠ водяной знак | 🥈Claude Opus 5через OpenRouter⚠ водяной знак | 🥉Kimi K3через OpenRouter | Kimi K2.5через OpenRouter | Grok 4.6через OpenRouter | DeepSeek v4 Proчерез OpenRouter | Qwen 3.8 Maxчерез OpenRouter | GPT-5.6 Solчерез Kie.ai | GPT-5.6 Terraчерез Kie.ai | Gemini 3.7 Flashчерез OpenRouter⚠ SynthID-метка | Claude Sonnet 5через OpenRouter⚠ водяной знак | Gemini 3.1 Proчерез OpenRouter⚠ SynthID-метка | DeepSeek v4 Flashчерез OpenRouter | Qwen 3.5 Plusчерез OpenRouter | Mistral Large 2512через OpenRouter | DeepSeek v3.1через OpenRouter | Gemini 2.5 Flashчерез OpenRouter⚠ SynthID-метка | Llama 4 Maverickчерез OpenRouter |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Тариф, $ за 1М токенов | 10.00 / 50.00 | 5.00 / 25.00 | 3.00 / 15.00 | 0.45 / 2.25 | 2.00 / 6.00 | 0.40 / 0.79 | 2.00 / 6.00 | кредиты | кредиты | 0.375 / 1.875 | 2.00 / 10.00 | 2.00 / 12.00 | 0.05 / 0.10 | 0.26 / 1.56 | 0.50 / 1.50 | 0.55 / 1.65 | 0.30 / 2.50 | 0.20 / 0.80 |
| Цена за готовую статью | $0.243 | $0.139 | $0.201 | $0.011 | $0.030 | $0.003 | $0.127 | ≈ $0.03 | ≈ $0.02 | $0.010 | $0.047 | $0.095 | $0.0003 | $0.006 | $0.006 | $0.003 | $0.013 | $0.001 |
| Время генерации | 68 с | 82 с | ~190 с | 42 с | 97 с | 84 с | 362 с | ~90 с | 63 с | 37 с | 59 с | 74 с | 42 с | 51 с | 61 с | 227 с | 30 с | 13 с |
| Объём (бриф: 1200–1600 слов) | 1358 | 1498 | 1201 | 1045 | 1449 | 1329 | 1472 | 1540 | 1520 | 1487 | 1301 | 1737 | 1168 | 1700 | 1162 | 1065 | 2410 | 520 |
| Соблюдение ТЗ | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | полное | 3 ссылки вместо 2 | полное | перебор объёма | 10 разделов из 12 |
| Сильная сторона | русский 9/10 — лучший в тесте | вода 9/10, конкретика 9/10 | конкретика и чистота 9/10 | конкретика 9/10 за цент | конкретика 9/10 | стабильно сильная | лучший её результат после EN | обе ссылки на месте | ровно | конкретика 9/10 | компактно | конкретика 9/10 | цена | связный текст | русский приличный | дёшево | скорость | быстро |
| Слабость | самая дорогая; судьёй была она сама | дорого | статья получена со второго прогона — цена удвоилась | русский 7/10, коротковата | русский 8/10, платный reasoning | русский 7/10 | 18к reasoning-токенов | без ярких плюсов | без ярких плюсов | вода в связках | бледнее старших | вода 6/10, дорого | русский 6/10 — калька | вода 6/10 | лишняя ссылка (−10) | вода, короче брифа | вода 5/10, раздута | втрое короче брифа, русский 4/10 (−10) |
| Слепая оценка Fable 5 (0–100) | 88 | 86 | 85 | 83 | 80 | 80 | 80 | 79 | 78 | 78 | 78 | 74 | 72 | 70 | 79 | 62 | 60 | 42 |
| Балл (итоговый) | 88Качество | 86 | 85 | 83Цена/качество | 80 | 80 | 80 | 79 | 78 | 78 | 78 | 74 | 72 | 70 | 69 | 62 | 60 | 32 |
Таблица прокручивается вправо на узких экранах. Первая колонка закреплена.
Краткие итоги
- Самая качественная статья — Kimi K3 (86.2 из 100 в среднем): первая или в топ-3 на всех пяти языках, ни одного штрафа, без водяных знаков. ~$0.16 за статью.
- Формально выше только Claude Fable 5 (86.6), но со звёздочкой: она же была судьёй теста, стоит дороже всех ($0.25) и метит текст водяным знаком.
- Для массовой генерации — Kimi K2.5 (79.6 в среднем, ~$0.01 за статью): единственная дешёвая модель без провалов на всех языках. На немецком и испанском поток лучше лить через DeepSeek v4 Pro ($0.005), на французском — DeepSeek v4 Flash ($0.0003).
- Разброс цен — в 850 раз ($0.0003–0.26 за статью) при разнице качества всего в 1.5–2 раза. Дешёвые модели проигрывают не структурой, а стилем языка.
- Модель надо выбирать под язык: одна и та же модель прыгает на 27 баллов между языками (DeepSeek v4 Pro: 83 на испанском, 55 на французском; Gemini 3.1 Pro: 82 на немецком, 56 на испанском).
- Водяные знаки: все Claude (с августа 2026) и все Gemini (SynthID) метят генерируемый текст. Kimi, DeepSeek, Grok, Qwen, GPT-5.6 через Kie.ai — пока нет.
Как проводился эксперимент
- 18 моделей × 5 языков = 90 статей. Каждая модель получила один и тот же жёсткий бриф на английском, французском, немецком, испанском и русском: практическая статья-инструкция ~1500 слов, обязательная структура из 12 разделов, чистый HTML, одна таблица, ровно 2 ссылки с заданными анкорами, вежливое обращение к читателю.
- Все генерации — реальные вызовы API с фактическим списанием денег (в основном через OpenRouter, две модели через Kie.ai). Цены в таблицах — то, что реально списалось, а не прайс-лист.
- Оценка в два контура. Механический: число слов, ссылки, структура, валидность HTML, детекторы обращения (tu/vous, Duzen/Sie, tuteo/usted, ты/вы) — за объективные нарушения брифа начислялись штрафы (пропущенная ссылка −10, сломанная структура −10). Качественный: слепое судейство моделью Claude Fable 5 — статьи подавались под анонимными номерами в случайном порядке, судья ставил баллы по четырём осям (вода, ритм, конкретика, естественность языка).
- Итоговый балл = слепая оценка − штрафы. Один прогон на модель на язык: это не статистика на сотнях генераций, но систематические провалы (потерянные ссылки, вода, канцелярит) видны и с одного раза.
- Бюджет всего эксперимента — около $17: 90 генераций плюс 90 слепых судейских оценок.
Самая качественная статья
| Модель | EN | FR | DE | ES | RU | Среднее | Ср. цена/статья | Вердикт |
|---|---|---|---|---|---|---|---|---|
| 🥇 Kimi K3 | 86 | 86 | 86 | 88 | 85 | 86.2Чемпион | $0.164 | Первая или в топ-3 на всех пяти языках, ни одного штрафа за контент. Без водяных знаков. |
| 🥈 Claude Fable 5 | 88 | 86 | 85 | 86 | 88 | 86.6* | $0.254 | Формально лучшее среднее, но со звёздочкой: судила сама себя (и оба своих «лучших» языка — EN и RU), самая дорогая, водяной знак. |
| 🥉 Claude Opus 5 | 88 | 79 | 80 | 86 | 86 | 83.8 | $0.145 | Топ на EN/ES/RU, проседает на FR/DE. Водяной знак. Вдвое дешевле Fable 5 при том же классе. |
| Kimi K2.5 | 85 | 76 | 80 | 74 | 83 | 79.6 | $0.010 | Цент за статью, 13–72 с. Сильная на EN/RU, слабее на романских языках. Оптимум для массовых батчей. |
| Grok 4.6 | 80 | 80 | 79 | 80 | 80 | 79.8 | $0.034 | Феноменальная ровность: 79–80 на всех пяти языках без единого выброса. Но перебор объёма и платный reasoning. |
| DeepSeek v4 Pro | 83 | 55 | 82 | 83 | 80 | 76.6 | $0.005 | Полкопейки за статью, стабильно сильная везде, кроме французского («ты»-обращение). Лучшая дешёвая для EN/DE/ES/RU. |
| Gemini 3.7 Flash | 74 | 73 | 81 | 78 | 78 | 76.8 | $0.009 | Крепкий недорогой середняк, пик — немецкий. SynthID-метка. |
| GPT-5.6 Sol | 69 | 64 | 78 | 82 | 79 | 74.4 | ≈ $0.03 | Качели: на EN/FR теряла обязательную ссылку, на DE/ES/RU — чистые сильные статьи. |
| Qwen 3.8 Max | 78 | 82 | 70 | 68 | 80 | 75.6 | $0.118 | Хороша на FR/RU, но reasoning не отключается (до 18к токенов) — цена непредсказуема. |
| DeepSeek v4 Flash | 64 | 76 | 67 | 82 | 72 | 72.2 | $0.0003 | Абсолютный минимум цены. На ES — топ-5, на остальных языках текст-калька. |
| Gemini 3.1 Pro | 70 | 71 | 82 | 56 | 74 | 70.6 | $0.080 | Непредсказуема: отличный немецкий, провальный испанский. SynthID-метка. |
Для массовой генерации
| Язык | Премиум (лучшая статья) | Цена | Массовая генерация (поток) | Цена | Комментарий |
|---|---|---|---|---|---|
| Английский | Claude Opus 5 (88) | $0.116 | Kimi K2.5 (85) | $0.009 | Редкий случай: массовая модель всего на 3 балла ниже премиума при цене в 13 раз меньше. На EN можно почти всё лить через K2.5. |
| Французский | Kimi K3 (86) | $0.140 | DeepSeek v4 Flash / Kimi K2.5 (по 76) | $0.0003 / $0.009 | Разрыв премиум-массовка самый большой (10 баллов): французский — сложный язык для дешёвых моделей. DeepSeek v4 Pro запрещён («ты»-обращение). |
| Немецкий | Kimi K3 (86) | $0.165 | DeepSeek v4 Pro (82) | $0.012 | v4 Pro отстаёт от премиума всего на 4 балла. Запасной вариант — Gemini 3.7 Flash (81, но SynthID-метка). |
| Испанский | Kimi K3 (88) | $0.240 | DeepSeek v4 Pro (83) | $0.003 | Обе категории сильные; v4 Flash (82) ещё в 10 раз дешевле, если объёмы очень большие. |
| Русский | Claude Fable 5 (88) | $0.243 | Kimi K2.5 (83) | $0.011 | Без водяного знака в премиуме — Kimi K3 (85), но помнить про её отказ на «сером» брифе. Opus 5 (86) — компромисс. |
| Все 5 языков | Kimi K3 (86.2) | $0.164 | Kimi K2.5 (79.6) | $0.010 | Общий выбор: один вендор на обе категории. Fable 5 формально выше (86.6*), но самосудейство, цена и водяной знак. |
⚠ Важно про Claude (обе модели): с 2 августа 2026 Anthropic встраивает невидимые водяные знаки во весь генерируемый текст — требование статьи 50 EU AI Act, применяется глобально, без возможности отключения. Метка на уровне модели, на читаемость не влияет, но факт генерации ИИ становится технически доказуемым. Правило действует для моделей, выпущенных после этой даты; на более ранние Anthropic обещает распространить поддержку в ближайшие месяцы. Публичного детектора пока нет (API детекции анонсирован 14 августа, не выпущен). Для задач, где происхождение текста не должно быть доказуемым, закладывайте этот риск — или берите модели без водяных знаков (OpenAI для обычного текста его пока не внедрил, DeepSeek, Kimi, Mistral, Grok и Llama — тоже). У Gemini метка SynthID стоит давно — Google встроил её в текстовый вывод ещё в 2024, у него в отличие от Anthropic есть публичный детектор.
Как проводился тест
- Один и тот же бриф отправлен во все модели без изменений: практическая статья-инструкция на иностранном языке, ~1500 слов, обязательная структура из 12 разделов (H2/H3) — от постановки проблемы через пошаговые действия до таблицы типовых ошибок и FAQ, чистый HTML без обёрток, ровно 2 ссылки с заданными анкорами. Жёсткий бриф выбран специально: на свободной теме любая модель пишет сносно, разница видна именно на соблюдении ограничений.
- Все вызовы — через API с фактическим списанием: цена в таблице это реальные деньги за конкретную генерацию, а не расчёт по прайсу. Основной маршрут — OpenRouter (тарифы моделей там совпадают с официальными, наценки на токены нет; сверял Kimi K3 напрямую у вендора — вышло даже чуть дороже из-за разброса скрытых reasoning-токенов: $0.167 против $0.140). GPT-5.6 Sol вызывался через Kie.ai — кредитную площадку, где цена пересчитывается из кредитов (~$0.005/кредит).
- Каждая статья прошла два контура проверки: механический QA (число слов, ссылки, структура, валидность HTML) и слепую оценку качества моделью Claude Fable 5: каждая статья подавалась судье под анонимным номером в случайном порядке, без названия модели, с рубрикой по четырём осям — вода/шаблонность, ритм и структура, конкретика и практическая польза, естественность языка. Первый прогон судейства пришлось забраковать и повторить: судья штрафовал статьи за то, что прямо требовал бриф (SEO-анкоры в точном написании), и за «обрывы», которые оказались обрезкой текста при подаче — во втором прогоне тексты подавались целиком и с контекстом брифа. Сама Fable 5 тоже участвовала как генератор; её статью судили по тем же правилам под тем же анонимным номером.
- Один прогон на модель. Это не статистика на сотне генераций — но провалы вроде пропущенной обязательной ссылки или SEO-воды видны и с одного раза.
Выводы
- Водяные знаки у Claude — с августа 2026 тексты Opus 5 и Fable 5 несут невидимую метку генерации (EU AI Act). Для SEO-контента, где важна недоказуемость происхождения, это минус обеих моделей, несмотря на верхние строчки рейтинга.
- Язык меняет рейтинг. На английском Claude Opus 5 и Fable 5 делят первое место (88), Kimi K2.5 выпрыгивает на 4-е (85 баллов, 13 секунд, цент за статью — лучшая цена/качество EN), а DeepSeek v4 Pro реабилитируется (83): его французская болезнь «тыканья» в английском не существует. DeepSeek v4 Flash на EN сам добавил 3 лишние ссылки — штраф; на FR такого не было. Модель надо выбирать под язык проекта, а не по общему рейтингу.
- Нужен максимум качества — Kimi K3: лидер слепой оценки (86), живой французский, все требования брифа. Claude Fable 5 набрала столько же, но вдвое дороже, с водяным знаком и с оговоркой: судьёй была она сама. Claude Opus 5 после слепого прогона опустилась с 1-го на 5-е место — судья поймал корявую интеграцию второго анкора и старый год в заголовке.
- Нужен поток статей за копейки — DeepSeek v4 Pro: полкопейки за статью, конкретика уровня лидеров. Но слепая оценка вскрыла системный дефект — модель пишет читателю «ты» вместо «вы», что для публичных гайдов недопустимо; слепой балл 55 против моих первоначальных 90. Дефект лечится одной строкой в задании, после чего цена/качество снова вне конкуренции — но из коробки это факт против модели.
- Переплата без выигрыша — Claude Fable 5: самая дорогая модель теста пишет не лучше своего же младшего собрата Opus 5.
- Скрытая статья расходов — reasoning-токены: у Qwen 3.8 Max их нельзя отключить (~6.7к токенов в каждой генерации), у Kimi K3 они добавляют разброс к цене. Модели без скрытых токенов (обе Claude, оба DeepSeek, Gemini) дают предсказуемый чек.
- Скорость ≠ качество — Gemini 2.5 Flash генерирует за 37 секунд, но выдаёт корпоративную воду с перебором объёма. Для статей не рекомендую.
- Новички второй волны — Grok 4.6 сразу четвёртый (89): живой текст уровня лидеров, но перебор объёма и платный reasoning. DeepSeek v4 Flash — новый ценовой рекорд: $0.0004 за статью с полным соблюдением структуры, текст проще v4 Pro, но для массовки этого хватает. Llama 4 Maverick — единственный полный провал: половина брифа проигнорирована.
- Роутер на качество не влияет: одна и та же модель через разные API-шлюзы выдаёт одинаковый уровень — сравнивал на живых вызовах. Разница только в цене и в наборе доступных моделей.



















