Связаться

Кошка, шапка, кисточка

Стандарт ОИРОМ как зеркало профессии, в которое никто не хотел смотреть

Семнадцатого августа я опубликовал в чате ResearchOps разбор отраслевого стандарта юзабилити-тестирования, который выпустил ОИРОМ и обследование ста тридцати сайтов исследовательских компаний. Ожидал обсуждения документа. Получилась дискуссия, которая шла с десяти утра до восьми вечера: двадцать шесть участников, двести сорок девять сообщений.

Про документ говорили весь день, и к вечеру выяснилось про него нечто важное. Но главным оказалось не это. Выяснилось, что мы не можем договориться не о стандарте, а о словах, которыми описываем собственную работу. О границах методов. О том, что считать тестированием. О том, нужны ли профессии правила или достаточно квалификации.

Ниже не пересказ дня, а разбор позиций. Имён я не называю: дискуссия шла в закрытом чате, и цитировать людей поимённо без их согласия я не вправе. Цитаты дословны, включая опечатки и смайлики; сокращения помечены.

Зачем вообще нужны правила

«Какую реальную проблему по нашему мнению действительно решат стандарты?»

Первый раскол обнаружился в первый час и не разрешился к вечеру.

Позиция первая: качество работы обеспечивается квалификацией, а не нормой.

«Гораздо больше влияния окажет опыт, насмотренность, софты харды и пытливый ум исполнителя.»

«Независимо от наличия и версий стандартов, огромное количество прекрасных исследователей великолепно делают свою работу. Будут клевые понятные стандарты — клево. Не будут — ну окей»

Довод в её пользу выглядит проверяемым: в России действует стандарт доступности сайтов, есть курсы, есть люди, преданные теме. Привело ли это к тому, что сайты стали доступнее? Привело ли к росту заказов на проверку доступности? По наблюдению говорящего — нет. Норма существует, практика не изменилась.

Но именно этот пример устроен обратным образом, и хронология здесь решает всё.

ГОСТ Р 52872 «Интернет-ресурсы. Требования доступности для инвалидов по зрению» введён в действие в 2012 году. Восемь лет он существовал ровно так, как описано выше: документ есть, рынка проверок нет, курсов почти нет. Дальше вступил регулятор. Информационные письма Банка России 2017 года — о доступности услуг кредитных организаций и некредитных финансовых организаций — и письмо декабря 2020 года о доступности дистанционных, то есть цифровых, каналов адресовали банкам рекомендации, которых те не могли проигнорировать.

Существенная деталь: письма не изобретали требований. Они ссылались на тот же ГОСТ Р 52872 и на международные рекомендации WCAG. Требования были прежние; изменилось одно — на них указал тот, чьё мнение банк учитывает.

После этого и появилось всё перечисленное в возражении. Банки начали формировать команды незрячих экспертов по невизуальной доступности — специальность, которой до того на рынке практически не существовало. Возник спрос на аудит и, следом за ним, курсы. То есть курсы и преданные теме люди — не фон, на котором норма не сработала, а результат того, что норма наконец получила адресата.

Порядок событий обратный тому, который подразумевает возражение: не «стандарт есть, а спроса нет», а «стандарт был, спроса не было; регулятор сослался на стандарт — появился спрос».

Из этого следует требование к любому, кто предлагает писать стандарты: сначала докажи, что документ что-то изменит.

«Будет обидно потратить силы и время крутых специалистов, написать много документов или один огромный сложный документ, который будет идеально отвечать всем стандартным и корнер кейсам методологии, которым заказчики не будут пользоваться.»

К этой же позиции примыкает более резкая формулировка:

«я уверен, что ни аттестация, ни сертификация, ни стандарт от оиром, эсомара, ИСО и далее везде — ни разу не решение. И даже наоборот, скорее в минус. А единственное решение — разговаривать с клиентом»

Позиция вторая: норма начинает работать, когда на неё ссылается тот, чьё мнение нельзя игнорировать.

Из той же истории следует и второй вывод. Письма Банка России формально никого не обязывают — это рекомендации. Обязательной силы у них нет, и тем не менее они сделали то, чего восемь лет не мог сделать сам стандарт. Один из банков за пару лет прошёл из середины отраслевого рейтинга доступности в топ. Месяцем ранее регулятор собирал маркетплейсы; методика самооценки, показанная на этой встрече, вызвала предметный интерес — то есть механизм продолжает работать и за пределами банковского сектора.

Второй довод — исторический. Первым случаем государственного регулирования эргономики стало министерство обороны США: поставщики обязаны были подтверждать соответствие эргономическим требованиям, иначе не допускались до закупок. Норма создала рынок оценки, а не наоборот.

Третий довод — из обследования. Из двадцати девяти компаний, заявляющих юзабилити-тестирование, метрики называют семь, любое методическое основание — девять. Заказчику нечем сравнить предложения и не на что ссылаться в техническом задании.

Как разошлись. Первая позиция не приняла ни одного из доводов, но и не опровергла их — она каждый раз сужала предмет. Всплеск заказов на доступность — «в плане разработки или исследований?». Рост банка в рейтинге — «В ВТБ насколько помню всегда была крутая исследовательская команда», а дальше объяснение через личную волю руководителя: «нужна железная воля и огромная эмпатия чтобы добиться включения доступности в требования (даже с наличием ИСО, да)». Прецедент американского министерства обороны — «он ничего не говорит о том, есть ли потребность в стандартах у бизнес-заказчика в РФ».

Объяснение через личную волю тут показательно, и оно требует разбора, потому что выглядит убедительно. Да, за формированием команды незрячих экспертов в конкретном банке стоял конкретный человек — руководитель департамента цифрового бизнеса. Но воля и эмпатия у отдельных людей были и до 2017 года, а команды появились после писем. Норма не заменяет волю — она даёт ей опору: превращает личную убеждённость в аргумент, который проходит защиту бюджета. Разница между «я считаю, что это важно» и «на это ссылается регулятор» и есть то, ради чего пишут стандарты.

Требование, которым первая позиция закончила, звучит так: доказательство должно быть про российского бизнес-заказчика, здесь и сейчас. Требование законное. Пример с доступностью ему отвечает — но касается регулируемого сектора, а не рынка в целом.

Третья позиция: прежде чем обсуждать документ, надо понять, кому он адресован.

«хорошо бы понять, а он зачем? 1. зачем он нужен агентствам / исполнителям 2. зачем он нужен клиенту 3. зачем он нужен Оирому […] Лично для себя я не вижу, что изменится. За одним исключением — рассказывать студентам про что должно быть в брифе и что должно быть в методологии станет проще»

Три вопроса повисли в воздухе. Ответа на них в дискуссии не прозвучало — и это, пожалуй, самое неприятное наблюдение дня. Сообщество, которое не может сказать, зачем ему правила, не договорилось о том, что именно оно делает.

Франкенштейн и шампунь два-в-одном

«Тоже не понимаю, почему глубинное интервью + UX тест в одном флаконе — равно чудовищно или вандализация»

Спор начался с формулировки «глубинное интервью с элементами юзабилити-тестирования», названной чудовищной. Восемь часов выяснялось, что за ней стоят две несовместимые картины профессии.

Позиция первая: метод оценивается по результату.

«мой опыт показывает отличные результаты при сочетании этих подходов, особенно если нам нужна сегментация, когда ты хочешь и на елку влезть и не поцарапаться и продукт и маркетинг»

«Мы миксуем регулярно. Да, виды интервью могут отличаться, не всегда это глубинка. Но и глубинка тоже. Более высокие требования к интервьюеру, тщательная подготовка, оценка рисков и того, чем готовы пожертвовать. И всё получится :)»

Логика последовательная. Задача заказчика решена, данные получены, продукт исправлен — предъявить нечего. Смешение не бесплатно, и это признаётся прямо: выше требования к интервьюеру, нужна подготовка, приходится решать, чем жертвовать. Речь не о небрежности, а о профессиональном выборе, за который человек отвечает.

Довод об универсальности:

«У шампуня и бальзама ополаскивателя цели тоже разные, но без проблем объединяют в одном флаконе. На мой взгляд „цели разные” ни разу не аргумент.»

Позиция вторая: смешение разрушает понятие, а с ним и возможность договориться.

Предмет спора здесь не результат отдельного проекта, а слово. Показывать прототип на интервью можно и нужно — но это не тестирование. Тест и интервью различаются не набором действий, а тем, откуда берётся вывод: из поведения или из слов. Если оба называются одним словом, различие исчезает — а вместе с ним исчезает возможность объяснить заказчику, почему в одном случае достаточно пяти участников, а в другом требуется пятьдесят.

Довод от времени: интервью требует своего часа, тест — своего; в одном сеансе качественно не выходит ни то ни другое, а внимание участника к концу падает, и последние задания делаются на отвали.

Столкновение дало третью позицию, которой не было ни у кого.

«Вижу некоторое отличие в позициях „нужно учитывать эффект усталости респондента” и „категорически нельзя миксовать в одном интервью и «поговорить» и юикс тест”. По первой позиции нет предмета для спора. По второй — и не согласен, и аргументов в поддержку пока не вижу»

Разделение точнее того, которое предлагали обе стороны. Утомление участника — техническое обстоятельство, против которого никто не спорит. Запрет на смешение — другое утверждение, и его никто не защищал: его приписали второй позиции в пылу спора.

Решающий довод пришёл со стороны методологии.

«так смещение ответов будет потом в глубинке после тестирования […] оценка интерфейса начнет заражать ответы на глубинке, прайминг и тд и тп […] Это методологически неоднозначно»

Это перевод спора с языка чистоты понятий на язык достоверности данных: взаимодействие с интерфейсом влияет на последующие ответы, эффект известен и имеет название. Первая позиция согласилась немедленно — тот же участник, что защищал шампунь два-в-одном, ответил: «С этим нельзя не согласиться, да».

Итог ветки сформулировала первая позиция, и не в свою пользу:

«Ок, в итоге продвинулись от чудовищно и вандализм к „может быть смещение” и методологически неоднозначно. Отлегло :)»

Шутка справедливая. Пока упрёк держался на возмущении, он не двигался: одна сторона называла практику чудовищной, другая — успешной, и обе были правы в своих терминах. Двинулся он тогда, когда его перевели в утверждение о смещении оценок, — то есть когда у спора появилась проверяемая часть.

Мнякля

«вместо понятий используем синкреты — кошка, шапка, кисточка — называются одним звуком „мнякля”, потому что все пушистые. Это психология, а не филология. Понятия в отличии от синкретов конвенциональны, а не индивидуальны.»

Синкрет — термин Выготского. На ранней стадии развития мышления ребёнок объединяет предметы не по существенным признакам, а по случайному сходству: кошка, шапка и кисточка — «мнякля», потому что все пушистые. Это не ошибка и не глупость. Это стадия, которую перерастают.

Примеры лежали в самой дискуссии.

На вопрос, какое определение юзабилити-теста используется в работе, прозвучало:

«Для меня ю-тест — это всегда, когда даешь задание что-то сделать в интерфейсе и наблюдаешь за выполнением задачи»

Это не определение юзабилити. Это описание процедуры наблюдения. Юзабилити есть свойство продукта, а не действие исследователя; в стандартах оно определяется через степень, с которой определённый пользователь достигает определённых целей в определённых условиях. Из первого определения следует: наблюдай и делай выводы. Из второго: измерь, зафиксируй контекст, опиши пользователя. Это разные профессии, называемые одним словом.

Почему так вышло, объяснила ещё одна позиция:

«индустрия UX так разрослась, что образовалось много разных точек зрения (на термины, на методологии и другие нюансы), которые живут в своих ограниченных пузырях. И то кто входит в профессию, цепляет взгляды оттуда, откуда начинает. А когда подрастет — несет это знание другим на своих курсах и/или через менторство.»

«Кажется, что матч за терминологию мы уже давно проиграли!»

Синкреты воспроизводятся через обучение. Каждый ментор передаёт свою «мняклю» следующему поколению. Тридцатилетний стаж не помогает: «Я тридцать лет в исследованиях и двадцать из них ни разу не слышал ни про проблемные интервью, ни про решенческие. И как-то жил с этим, без проблем.»

Без общих понятий нет общей профессии. Есть множество индивидуальных практик, внешне похожих, внутри устроенных по-разному.

Аргумент против этого рассуждения тоже прозвучал, и он практический:

«Вопрос всем, кому не нравится „интервью с элементами юзабилити-тестирования” […] Если вместо этого в разделе „Методология” пишут просто через запятую: „интервью, юзабилити-тестирование” — так лучше? Это не вызывает боль?»

Ответ: да, лучше. Перечисление через запятую означает два исследования с разными выборками и разными выводами. Формулировка «интервью с элементами теста» означает одно исследование, о результатах которого нельзя сказать, откуда они взялись.

Стандарт как щит

«мне кодекс помогал нечасто и только для одной цели: отбиться от внутренних заказчиков, чтобы мотивировать позицию — в исследованиях так нельзя»

Единственный ответ на вопрос «кому нужна норма», который в дискуссии не оспорил никто.

Речь о кодексе ESOMAR, и адресат нормы здесь не агентство и не ассоциация. Это исследователь внутри компании, которому нужно отказать заказчику, требующему методологически недопустимого. «Мы, конечно, над одним продуктом с вами работаем, но у исследователей есть свой отраслевой стандарт, и мы в исследованиях так не делали и делать не будем, вот пункт есть.»

Без такого документа границы допустимого объясняются каждый раз заново и своими словами. С ним — предъявляется пункт.

Оттуда же — наблюдение об адресате разбираемого стандарта:

«Мне показалось, что ЦА и этого стандарта по UX — не профессионалы в UX, поэтому здесь и все обобщенное и упрощенное максимально. Возможно поэтому именно профессионалами он воспринимается как делаем хорошо, плохо не делаем.»

Линии разлома

Дискуссия обнажила три раскола, которые проходят не между людьми, а через профессию.

Доказуемость против квалификации. С одной стороны метрики, выборки, интервалы, повторяемость. С другой — «опыт, насмотренность, софты харды и пытливый ум исполнителя». Обе стороны правы в разных контекстах. Но без понимания, когда какой подход применим, всё снова становится «мняклей»: всё исследование, всё полезно, разница несущественна.

Наблюдение против интервью. Этот раскол в дискуссии был проговорён точнее всего, и не автором разбора. Одна позиция утверждала: всякий разговор, где один спрашивает, а другой отвечает, есть интервью, и модерируемый тест — тоже интервью. Другая возразила методологически:

«Наблюдение базово раскладывается на включенное и невключенное […] юзабилити-тест по своей механике и основному источнику информации (действия, а не слова) попадает скорее в эту категорию»

«основные выводы про проблемы в интерфейсе мы получаем именно из поведения респондента. Слова и диалог скорее нам нужны для большего понимания этих действий. Конкретно в этом случае определение будет влиять очень сильно на результат. Мы не спрашиваем, что неудобно, а видим это. Это влияет и на необходимую выборку и на доверие к результ[атам]»

Замечу здесь одно обстоятельство, которое стоит всей дискуссии. Это сказал человек из списка тех, кого ассоциация поблагодарила за участие в разработке стандарта. То есть различение, отсутствие которого я ставлю документу в упрёк, сформулировал в чате один из его же соразработчиков. Экспертиза в сообществе есть. В документ она не попала.

Инженерия против маркетинга. Самая глубокая линия была обозначена одной репликой и осталась неразвёрнутой:

«следующий уровень айсберга — это то, что пресловутый HCI — Human-Computer Interaction, это не исследовательская профессия, не психология и не социология, а часть computer science»

Если это так, то юзабилити-инженер и исследователь рынка — не соседи по цеху, а представители разных дисциплин, случайно оказавшиеся у одного объекта. Я как инженерный психолог считаю себя юзабилити-инженером, и исследования — лишь часть моей работы. После первых моих выступлений на РИФе мне говорили: «Мы всё поняли, то, что ты делаешь, — это маркетинг».

К этому разговору сообщество не готово. Но он предстоит.

Что случилось со стандартом

К вечеру в дискуссию включился участник рабочей группы, готовившей документ. Дальше — прямая речь, и она объясняет разрыв между качеством людей и качеством текста.

О мотивах ассоциации:

«Для ОИРОМ вполне понятно, потому что они зарабатывают на том, что проводят проверку организаций на соответствие нормам, описанным в стандартах.»

О том, почему документ оказался тонким:

«Потому что ОИРОМу часть из написанного просто впихнуть некуда — в рамках их коммерческой деятельности.»

Группа работала с ноября 2025 года, версий было много. Написанное оказалось полнее опубликованного, и часть материала ассоциация сократила — не по методологическим причинам, а потому, что её коммерческая модель этого не вмещала.

О статусе документа для самой ассоциации:

«для них самих — этот стандарт это кот в мешке, будет ли с него какой-то „выхлоп” они не знают. И стандарт собирался не под конкретные бизнес цели, а под „будущие возможности его использования”.»

И деталь, объясняющая мою собственную ошибку. Разбирая документ, я опирался в одном месте на публикацию участника разработки, где приводились числовые требования к выборке, — в итоговом тексте их нет. Оказалось:

«Артём Кузнецов в целом-то и писал заметки к полному тексту, а не к тому, что мы видим в стандарте […] документу, который был ещё более „оптимизирован” уже после его статьи.»

То есть текст резали как минимум дважды после того, как группа передала его ассоциации.

Наконец, о том, от чего группа отказалась сама:

«мы не стали вообще брать удалённые юзабилити-тестирования»

В разборе я установил по тексту, что двумя техническими требованиями документ делает немодерируемое тестирование несоответствующим себе. Теперь известно, что это не побочный эффект формулировок, а сознательное решение.

Получается институциональная проблема, а не проблема компетенции. Экспертиза была. Люди работали девять месяцев. Работу обрезали под то, что ассоциация умеет продавать, — и на выходе получился документ, в котором слово «качество» вне заголовка встречается трижды — о качестве записи, качестве связи и качественном прохождении сессии. О качестве самой работы — ни разу.

Рабочая группа собирается восстановить полную версию и опубликовать её:

«Надеюсь, что мы сможем восстановить полную версию и выложить её в паблик — как раз этим и хотели заняться в ближайшее время.»

Если это произойдёт, разбор придётся дополнять. Это лучший из возможных исходов.

Что происходит на самом деле

Пока шёл спор о словах, из чата сыпались случаи из практики. Каждый показывал, что проблема не в терминологии.

Мы поставляли айтрекеры мобильному оператору: настроили, обучили. Через некоторое время нас спросили, почему тепловые карты выходят бессистемными. Оказалось, исследователь сажал пользователя перед монитором, и они начинали обсуждать интерфейс. Глаза бродили по экрану случайно. Нам не приходило в голову, что кто-то станет разговаривать во время выполнения задания.

В другом проекте требовалось сравнить три варианта главной страницы приложения. Количественная оценка методом первого клика дала ясный результат: один вариант заметно впереди. Заказчик попросил показать все три одновременно и спросить, какой нравится. Понадобились усилия, чтобы объяснить про эффект порядка предъявления и добиться парного сравнения.

Прямо сейчас у меня проект в тупике: интервью с закупщиками показали, что бюджетный контроль, ради которого затевалась разработка, пользователям не нужен. Отчёт сдан, заказчик несколько дней не выходит на связь. Последнее сообщение: «Читаю отчёт… думаю…» У меня была шутка, что при расхождении результатов исследования с мнением заказчика всегда побеждает заказчик. Почему-то никто не смеётся.

И самое неприятное — то, что называют validation theater: исследование заказывают не для открытия, а для подтверждения принятого решения. Городские власти пару лет назад решили опросить горожан, какого цвета должны быть трамваи, красного или коричневого. Очень опытная исследовательница аккуратно спросила: «А вы какой результат исследования ожидаете?»

Отдельно стоит случай двадцатилетней давности, рассказанный в чате, — потому что он против моей позиции.

Холл-тест в компании, занимавшейся исследованиями рынка: айтрекер, прототип с фиксацией времени и опечаток, молчаливый наблюдатель, затем анкета. Сто человек.

«Внутренний заказчик сказал, что это идеальное ТЗ для разработки, и пошел править продукт. Через месяц мы повторили упражнение на исправленной версии, и в отчете прошлись по всем ранее данным рекомендациям — удалось исправить практически все»

«Да, наверное с точки зрения классиков это было „всё смешалось в доме Облонских”, оливье с кетчупом, но мне не стыдно ни за один элемент в этой методологии, потому что задачу решили максимально эффективно.»

Смешение методов, суммативная выборка, замер до и после, проверяемый результат. Сделано в мире исследований рынка, в начале двухтысячных, когда UX-отрасли в России не существовало. Против этого мне возразить нечего — и это ровно то, что показало обследование сайтов: качество работы слабо связано с происхождением компании.

Что дала эта дискуссия

Практик, не участвовавший в разработке, полдня выяснял, что не так с формулировкой, которой пользуется, — и к вечеру сказал:

«от этого зависит, признаю я этот стандарт или нет. и по итогу я пришла к выводу, что я, являясь частью сообщества, не хочу признавать этот стандарт, потому что получился супер запутанный диалог»

В разборе я утверждал, что соответствие этому документу нельзя ни установить, ни оспорить. Здесь это произошло наблюдаемо: человек попытался применить стандарт к своей работе, не смог и от стандарта отказался. Не из несогласия с содержанием — из невозможности им пользоваться.

Мы не договорились. Но впервые стало видно, о чём именно не можем договориться, а это больше, чем даёт документ на девяти страницах.

Стандарт ОИРОМ — не проблема и не решение. Он рентгеновский снимок. За двадцать лет из горстки энтузиастов выросли тысячи практиков, и каждый унаследовал терминологию от своего ментора: своё понимание тестирования, свою границу между тестом и интервью, свою «мняклю». Каждый работает хорошо — в своих терминах. Но стоит двум людям из разных пузырей сесть за один стол, и выясняется, что они говорят на разных языках.

Стандарты — не ограничения. Это декларация об общих ценностях: конституция, а не уголовный кодекс. Написать её могут только те, кто понимает обе стороны каждого раскола.

Приглашение, которым закончился день, прозвучало от участника рабочей группы:

«А хочется правильных стандартов, что вам мешает их сделать? Мы будем только благодарны»

Это третья статья в серии. Первая — постатейный разбор стандарта ОИРОМ с шестнадцатью предложениями по доработке. Вторая — обследование 130 сайтов исследовательских компаний: кто на рынке заявляет юзабилити-тестирование и как его описывает. От анализа документа — к анализу рынка — к анализу профессии.