НЕЗАВИСИМОЕ ИССЛЕДОВАНИЕ / GPT-5.6 / 16 АВГУСТА 2026

Что меняет reasoning effort в реальной веб-задаче?

Я дал GPT-5.6 Luna, Terra и Sol один краткий промпт для первого экрана сайта на каждом уровне reasoning effort. Одна задача. Одна область оценки 1440×900, о которой модели не знали. Без примеров и доступа к моему сайту.

Это развитие знакомой SVG-матрицы на более прикладной задаче. Здесь модель собирает самодостаточный HTML/CSS/JavaScript hero и одновременно решает продуктовый аргумент, информационную архитектуру, типографику и взаимодействие. Тест охватывает начальную область рендера, а не готовность к публикации. Simon Willison: исходная 18-ячеечная матрица GPT-5.6 с пеликаном

3 модели × 6 уровней. На каждую запланированную ячейку приходится ровно одна завершённая страница; показаны все 18. Ни один завершённый ответ не редактировался, не заменялся и не исключался.

В этих 18 единичных примерах effort менял время, токены и цену. Матрица показывает вариативность решений, но не измеренный рейтинг визуального качества.

протестированных страниц
18
модели
3
уровней effort
6
расчётная общая стоимость
$4.74

Все 18 первых экранов

В каждой строке один уровень reasoning effort, в каждом столбце одна модель. Нажмите на любой первый экран, чтобы открыть исходный рендер 1440×900.

EFFORTLunaTerraSol

NONE

Website hero модели gpt-5.6-luna на уровне reasoning effort noneОткрыть 1440×900 ↗
Lunanone

$0.0065 · 1m 40.9s · 5,381 output · 0 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-terra на уровне reasoning effort noneОткрыть 1440×900 ↗
Terranone

$0.0779 · 1m 59.6s · 6,476 output · 0 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-sol на уровне reasoning effort noneОткрыть 1440×900 ↗
Solnone

$0.2274 · 2m 19.6s · 7,566 output · 0 reasoning

загрузился без переполнения

LOW

Website hero модели gpt-5.6-luna на уровне reasoning effort lowОткрыть 1440×900 ↗
Lunalow

$0.0051 · 1m 17.4s · 4,194 output · 47 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-terra на уровне reasoning effort lowОткрыть 1440×900 ↗
Terralow

$0.0671 · 1m 42.5s · 5,574 output · 67 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-sol на уровне reasoning effort lowОткрыть 1440×900 ↗
Sollow

$0.2683 · 2m 43.3s · 8,929 output · 66 reasoning

загрузился без переполнения

MEDIUM

Website hero модели gpt-5.6-luna на уровне reasoning effort mediumОткрыть 1440×900 ↗
Lunamedium

$0.0098 · 2m 28.3s · 8,178 output · 164 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-terra на уровне reasoning effort mediumОткрыть 1440×900 ↗
Terramedium

$0.0968 · 2m 27.3s · 8,049 output · 86 reasoning

горизонтальное переполнение: 190 px

Website hero модели gpt-5.6-sol на уровне reasoning effort mediumОткрыть 1440×900 ↗
Solmedium

$0.3680 · 3m 42.2s · 12,253 output · 250 reasoning

загрузился без переполнения

HIGH

Website hero модели gpt-5.6-luna на уровне reasoning effort highОткрыть 1440×900 ↗
Lunahigh

$0.0193 · 4m 52.6s · 16,101 output · 748 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-terra на уровне reasoning effort highОткрыть 1440×900 ↗
Terrahigh

$0.1579 · 3m 58.4s · 13,141 output · 250 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-sol на уровне reasoning effort highОткрыть 1440×900 ↗
Solhigh

$0.4208 · 4m 20.7s · 14,012 output · 280 reasoning

загрузился без переполнения

XHIGH

Website hero модели gpt-5.6-luna на уровне reasoning effort xhighОткрыть 1440×900 ↗
Lunaxhigh

$0.0197 · 4m 57.9s · 16,435 output · 1,552 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-terra на уровне reasoning effort xhighОткрыть 1440×900 ↗
Terraxhigh

$0.1683 · 4m 14.0s · 14,008 output · 483 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-sol на уровне reasoning effort xhighОткрыть 1440×900 ↗
Solxhigh

$0.7644 · 7m 42.2s · 25,464 output · 5,832 reasoning

горизонтальное переполнение: 180 px

MAX

Website hero модели gpt-5.6-luna на уровне reasoning effort maxОткрыть 1440×900 ↗
Lunamax

$0.0381 · 9m 33.3s · 31,727 output · 11,419 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-terra на уровне reasoning effort maxОткрыть 1440×900 ↗
Terramax

$0.5928 · 14m 57.3s · 49,388 output · 26,542 reasoning

загрузился без переполнения

Website hero модели gpt-5.6-sol на уровне reasoning effort maxОткрыть 1440×900 ↗
Solmax

$1.4341 · 14m 28.8s · 47,787 output · 21,401 reasoning

загрузился без переполнения

18 первых экранов сайтов от GPT-5.6 в матрице Luna, Terra, Sol и шести уровней reasoning effortОткрыть общую таблицу 4574×5830

Что действительно показывает этот прогон

01

Показанные примеры не сошлись к одному стилю.

В этой выборке каждый уровень effort дал иную визуальную идею, иерархию и плотность. Это описание показанной матрицы, а не доказательство того, что более высокий effort в среднем не улучшает визуальное качество.

02

Max был крупнейшим отдельным уровнем по затратам.

Три ячейки max стоили $2,06 — 43,5% общей расчётной цены — и занимали в среднем 13 минут на запрос. Три ячейки none стоили $0,31 и занимали около 2 минут: примерно в 6,6 раза дешевле и в 6,5 раза быстрее. Два разнесённых по времени батча ограничивают сравнение задержки между моделями.

03

Luna была самой дешёвой в этом ценовом срезе.

Все шесть страниц Luna загрузились в рамках заданной проверки первого экрана; их суммарная расчётная стоимость — $0,099. Шесть страниц Sol стоили $3,48, то есть примерно в 35 раз больше. Это сравнение цены токенов, а не качества дизайна, взаимодействий или готовности к публикации.

04

Переполнение по горизонтали возникало немонотонно.

В заданной проверке первого экрана все 18 страниц загрузились без исключений исполнения, ошибок консоли и внешних запросов. Переполнение свыше 1 px было только у Terra medium (190 px) и Sol xhigh (180 px). Это не вывод о других дефектах или работе взаимодействий.

Методика: минимум художественных указаний

Творческий промпт задаёт только цель продукта, желаемый эффект для аудитории и светлую тему. Отдельная техническая инструкция ограничивает формат ответа, но не дизайн.

Точный промпт пользователя

Create a complete, self-contained website hero for a product that helps organizations safely operate autonomous AI agents in production.

The goal of the site is to make technical decision-makers interested in the product.

Use a light theme.

Точное ограничение формата

Return only one complete self-contained HTML document beginning with <!DOCTYPE html>. Put all CSS and JavaScript inline. Do not use external assets, Markdown fences, or explanatory text.

Запуск и проверка

  1. Знаменатель: 18 запланированных ячеек, 18 запросов к моделям, 18 завершённых HTML-ответов и 18 показанных страниц. Повторных запросов к моделям — 0. Отредактированных, исправленных, заменённых или исключённых завершённых ответов — 0.
  2. Запросы шли двумя параллельными батчами, а не одним одновременным запуском. Luna стартовала 15 августа 2026 года в 23:04:50 UTC: шесть запусков уложились в 73 мс. Terra/Sol стартовали 16 августа в 08:49:15 UTC: двенадцать запусков уложились в 96 мс, на 9 ч 44 мин 24,643 с позже. Поэтому сравнение задержки и поведения между моделями может отражать разные условия сервиса или состояния alias.
  3. Размер области просмотра моделям не сообщался. После генерации каждый точный HTML-ответ отдавался локально и проверялся при 1440×900 в Chromium 150.0.7871.186. Скриншоты показывают только начальную область просмотра; мобильные результаты не генерировались и не вставлялись.
  4. Проверка наблюдала страницу от навигации через Page.loadEventFired и document.fonts.ready до дополнительных 500 мс ожидания. Она фиксировала исключения Runtime, вызовы console.error и сетевые запросы за пределы loopback, data: и about:blank; таймаут события загрузки — 30 секунд.
  5. Горизонтальное переполнение рассчитано как max(documentElement.scrollWidth, body.scrollWidth) минус window.innerWidth. Клики, отправка форм, поведение всей страницы и работа после публикации не проверялись.
  6. Каждый исходный ответ начинался с одного <!DOCTYPE html>, содержал ровно один HTML-документ, не имел Markdown-обёртки и внешних ссылок на стили, скрипты или медиаресурсы и побайтно совпадал с отрендеренным HTML. SHA-256 и размер каждой ячейки опубликованы в JSON.
  7. Модели не получали скриншоты, CSS, фирменные материалы, содержимое stranmor.com, приватные промпты или контекст скиллов. Они получили техническое ограничение формата выше, включая запрет внешних ресурсов; это сужает пространство решений, хотя и не задаёт эстетику.
  8. Учёт токенов: 1 584 входных + 294 663 выходных = 296 247 всего. 69 187 reasoning-токенов указаны внутри output_tokens_details и повторно не прибавляются.

Зачем делать это вместо ещё одного SVG-теста?

Визуальные сравнения reasoning effort уже есть. Simon Willison опубликовал 18 SVG с пеликаном на велосипеде для той же матрицы GPT-5.6 3×6; PlayCode затем использовал SVG с MacBook, чтобы точнее оценивать геометрию. Эти тесты изолируют рисование. Здесь проверяется, как те же уровни effort меняют самодостаточный первый экран сайта при кратком промпте. Simon Willison: исходная 18-ячеечная матрица GPT-5.6 с пеликаном

Поисковая проверка на 16 августа 2026 года нашла общие таблицы тестов GPT-5.6 и SVG-матрицы, но не публичное сравнение, где Luna, Terra и Sol создают один и тот же самодостаточный первый экран сайта на всех шести уровнях effort. Это результат ограниченного поиска, а не утверждение, что такой страницы нигде не может существовать.

Границы вывода

  • На каждую комбинацию model-effort приходится один результат, поэтому тест не оценивает среднее визуальное качество и разброс.
  • Luna и Terra/Sol запускались двумя батчами с разницей 9 ч 44 мин. Различия задержки и поведения между моделями не отделены от изменений условий сервиса или alias моделей.
  • Проверялась одна узкая категория: светлый B2B hero продукта для безопасной эксплуатации автономных AI-агентов. Для других продуктов, языков и жанров результат может измениться.
  • Время включает API-маршрут и сеть; это не чистое время вычислений модели.
  • Стоимость рассчитана по токенам и публичным ценам OpenAI API, зафиксированным 16 августа 2026 года. Цены могут меняться.
  • Автоматическая проверка охватывает одну начальную загрузку на desktop и видит загрузку, переполнение, внешние запросы, landmarks, focus CSS и reduced-motion CSS. Она не проверяет взаимодействия, всю страницу, готовность к публикации и не решает, красив ли дизайн или убеждает ли он человека.

Источники и данные

Скачать очищенные данные теста (JSON)Публичный набор содержит промпт, время двух батчей, учёт токенов, цены, браузерный протокол, SHA-256 каждой HTML-страницы, проверки соответствия и результаты валидации. Идентификаторы приватного шлюза и ответов намеренно исключены.