Полная версия:

Не рычите на собаку! Книга о дрессировке людей, животных и самого себя

скачать книгу бесплатно

Однако отрицательное подкрепление – это вовсе не то же самое, что наказание. В чем же разница? В первом издании этой книги я написала, что наказание – это воздействие, которое возникает после проявления поведения, нуждающегося в изменении, и, следовательно, не оказывает влияния на поведение. «Мальчик, которого отшлепали за плохие оценки в дневнике, может улучшить или не улучшить свои оценки, но он просто не в состоянии изменить те, что уже в дневнике проставлены». И действительно, когда мы сознательно наказываем кого-либо, то чаще всего делаем это слишком поздно. Но не в этом заключается основное различие между наказанием и отрицательным подкреплением.

Современные психологи-бихевиористы называют наказанием любое событие, которое прекращает поведение. Ребенок засунул шпильку в электрическую розетку. Мать хватает его и/или шлепает по руке: поведение, которое угрожает жизни, необходимо прервать немедленно. Поведение прекращается. В этот момент может начаться что-то другое – ребенок заплачет, мать расстроится и т. п., – но опасная привычка совать что попало в электрическую розетку, будет устранена, по крайней мере, в данный момент.

Б. Ф. Скиннер более точен в этом отношении. Он определяет наказание как нечто, что происходит, когда поведение приводит к утрате чего-либо желанного – удовольствия узнать, что произойдет, если засунуть шпильку в розетку, весьма характерного для детей, – или когда поведение приводит к каким-то нежелательным последствиям. Однако в обоих случаях, когда данное поведение прекращается, невозможно предсказать, повторится ли оно в будущем.

Мы знаем, что положительное подкрепление повышает вероятность желательного поведения в будущем, но наказание не приводит к предсказуемым результатам.

Например, схватив ребенка или шлепнув его по руке даже в самое подходящее время, может ли мать быть уверена в том, что он не попытается засунуть ту же шпильку в ту же розетку в другое время? Я в этом очень сомневаюсь. Спросите у любого родителя. Все мы стараемся спрятать мелкие предметы, закрыть розетки, передвинуть мебель, пока ребенок не вырастет.

Отрицательное подкрепление можно эффективно использовать для воспитания желательного поведения. При этом даже при наличии негативных стимулов процесс может быть относительно доброжелательным. Благодаря любезности специалиста по ламам Джима Логана, я могу привести прекрасный пример использования отрицательного подкрепления при дрессировке полудомашних лам, которых в США содержат как домашних животных, а во всем мире – ради ценной шерсти.

Ламы – животные пугливые и застенчивые. В этом они похожи на лошадей. Если их не воспитывать с раннего детства, приручить их очень трудно. Хотя обучение с помощью пищевого подкрепления великолепно подходит для лам, в тех случаях, когда животное слишком пугливо, чтобы подойти и взять у человека пищу, современные дрессировщики поступают следующим образом. Они используют кликер. Этот сигнал говорит ламе, что ее поступок заслужил подкрепление, но основное, реальное подкрепление заключается в устранении отрицательного подкрепления.

Это все равно, что сказать ламе: «Ты будешь стоять на месте, если я подойду к тебе на 30 футов? Да? Хорошо. Я щелкну моим кликером, повернусь и отойду.

А теперь ты будешь стоять на месте, если я подойду к тебе на 25 футов? Да? Хорошо. Я кликну и отойду».

Использование кликера для концентрации внимания на привычке стоять спокойно, когда страшный человек поворачивается и уходит, действует как положительное подкрепление. Такой прием позволяет сократить дистанцию между животным и человеком до минимальной величины всего за пять или десять минут. В этой ситуации все контролирует лама. Она стоит спокойно – и это заставляет человека отступить! Поэтому животное продолжает стоять спокойно, даже когда человек подходит прямо к нему.

Когда человек несколько раз касается ламы и тут же отступает, лед тает. Человек больше не кажется животному страшным. И вот тут-то наступает время корзинки с пищей. Коммуникативная петля выглядит следующим образом: «Могу я коснуться тебя, пока ты стоишь спокойно? Да? Клик – и вот вкусная, замечательная пища». Лама стремится получить положительное подкрепление, то есть пищу, поглаживание и ласку. Она понимает, что для этого нужно демонстрировать новое поведение – стоять спокойно вместо того, чтобы убегать сломя голову.

Такое использование отступления при проявлении желательного поведения является важным аспектом работы так называемых «заклинателей». При использовании подобного метода дрессировщик работает со свободной лошадью в ограниченном пространстве и за относительно короткое время превращает настоящую дикарку в лошадь, спокойно относящуюся к человеку. Совершенно дикая лошадь успокаивается настолько, что смиряется с седлом и наездником. Подобное мастерство может показаться настоящей магией.

Дрессировщики, использующие такие приемы, часто объясняют происходящее сверхъестественной силой. Хотя многие используют определенный звук или движение в качестве сигнала-маркера, или условного подкрепления, мало кто понимает, что именно он делает. Тем не менее в этой работе нет ничего магического. Это законы оперантного обусловливания в действии.

Хотя отрицательное подкрепление – довольно полезный процесс, очень важно помнить, что любое подобное действие несет в себе элемент наказания. Когда вы тянете за левый повод, пока лошадь не повернет, вы наказываете животное заранее. Чрезмерное увлечение отрицательными подкреплениями может привести к тому, что Мюррей Сидмен называет «осадком», то есть к нежелательному побочному действию.

Время подачи подкрепления

Как уже говорилось, подкрепление должно происходить одновременно с поступком, который необходимо модифицировать.

Время осуществления подкрепления – это информация. Она точно говорит ученику, что именно вам нравится.

Когда человек или животное пытается учиться, информационное содержание подкрепления становится еще более важным, чем само подкрепление. При тренировке спортсменов или танцовщиков инструктор часто кричит: «Да! Хорошо!», отмечая удачное движение. Такие выкрики дают человеку необходимую информацию, что гораздо полезнее последующего разбора в раздевалке.

Запоздалое подкрепление – это главная проблема начинающих тренеров. Собака сидит, но к тому времени, когда хозяин говорит: «Молодец! Хорошая собака!», она уже встала. Какое же поведение стимулирует произнесенное подкрепление? Правильно – не сидеть, а стоять. Когда у вас возникают подобные трудности, вы должны сразу же спросить себя, а не слишком ли поздно прозвучало подкрепление. Если вы работаете с человеком или животным и слишком захвачены процессом, будет полезно пригласить кого-нибудь еще, чтобы этот человек наблюдал за запоздалыми подкреплениями.

Мы слишком часто запаздываем с подкреплениями. «Дорогая, ты замечательно выглядела прошлым вечером». Подобный комплимент окажет совсем не то действие, что те же самые слова, произнесенные в нужный момент. Запоздалое подкрепление может оказать даже обратное действие («Что ты хочешь сказать? Что я сейчас плохо выгляжу?»). Мы трогательно полагаемся на слова, считая, что они смогут компенсировать неправильный выбор времени.

Слишком раннее подкрепление тоже неэффективно. Смотрители зоопарка в Бронксе никак не могли справиться с гориллой. Им нужно было перевести животное в открытый вольер, чтобы вычистить клетку. Но обезьяна сидела у дверей и мешала их закрыть. Смотрители и пищу бросали, и бананами гориллу заманивали, но зверь не обращал на них никакого внимания или хватал пищу и бегом возвращался на прежнее место, прежде чем двери удавалось закрыть. За помощью обратились к дрессировщику зоопарка. Он отметил, что размахивание бананами и подбрасывание пищи были попытками закрепить поведение, которое еще не проявилось. Это можно назвать простым словом «подкуп». Решение заключалось в том, чтобы не обращать внимания на гориллу, когда та сидела возле дверей, но поощрять ее пищей, когда она сама сойдет с этого места. Проблема была решена.

Мне кажется, что иногда мы используем подкрепление слишком рано. Особенно ярко это проявляется в отношениях с детьми. В результате мы стимулируем нежелательное поведение. («Молодец, девочка, вот так, ты все сделала почти правильно».) Такими словами мы стимулируем старание. Но между тем, чтобы постараться сделать и сделать по-настоящему, есть существенная разница. Жалобы «Я не могу» порой имеют под собой основание, но чаще всего они являются симптомами слишком раннего подкрепления.

Подарки, обещания, комплименты и все то, что поощряет еще не произошедшее поведение, ни в коей мере не подкрепляет желательное поведение. Все это подкрепляет то поведение, которое имеет место в данный момент, и в этом отношении его можно считать настоящим подкупом.

Время играет особенно важную роль, когда мы имеем дело с отрицательным подкреплением. Лошадь учится поворачивать налево, когда наездник тянет за левый повод. Но усвоит она навык лишь в том случае, если после поворота давление ослабеет. На этот раз подкреплением оказывается прекращение. Вы садитесь на лошадь, пришпориваете ее и направляете вперед. После этого нужно прекратить пришпоривать (если вам не нужно, чтобы она мчалась быстрее). Начинающие наездники часто забывают об этом. Им кажется, что пришпоривание – это нечто вроде бензина, необходимого для того, чтобы лошадь двигалась. Они постоянно пришпоривают лошадь, из-за чего она не получает никакой информации. В школах верховой езды появились даже этакие «железнобокие» лошади, которые с черепашьей скоростью передвигаются по манежу, сколько бы их ни пришпоривал наездник.

То же самое происходит с людьми, которых пилят и ругают родители, начальники или учителя. Если отрицательное подкрепление не прекращается при достижении желательного результата, оно не несет в себе никакой информации. Оно становится в буквальном и информационном смысле обычным «шумом».

Глядя по телевизору футбольные и бейсбольные матчи, я часто поражалась тому, насколько точно по времени игроки получали подкрепления. Как только игрок поступает именно так, как было нужно, зрители криками выражают свое одобрение. А посмотрите, как взаимодействуют между собой игроки, когда забит гол или одержана победа. У актеров все происходит по-другому. Даже на сцене аплодисменты звучат уже после того, как дело сделано. Киноактерам приходится еще труднее. Они могут получить подкрепление только от режиссера или оператора. Письма поклонников и хорошие рецензии приходят спустя много недель, а то и месяцев после съемок. Да они и сравниться не могут с реакцией огромного стадиона на успешный бросок игрока. Неудивительно, что многие кинозвезды болезненно жаждут поклонения и восторгов. Их работа не приносит удовлетворения, поскольку самые мощные и приятные подкрепления всегда оказываются запоздалыми.

Масштаб подкрепления

Начинающие дрессировщики, которые используют в работе с животными пищевые подкрепления, часто не понимают, насколько большим должно быть подобное подкрепление. Ответ очень прост: чем меньше, тем лучше. Чем меньше подкрепление, тем быстрее животное его съест. Это не только сокращает время ожидания, но еще и позволяет использовать за время сеанса большее количество подкреплений до наступления состояния насыщения.

В 1979 году я работала консультантом в Национальном зоопарке Вашингтона. Я учила сотрудников использованию системы положительного подкрепления. Одна из смотрительниц пожаловалась на то, что работа с пандой идет слишком медленно. Это показалось мне странным, поскольку интуитивно я чувствовала, что панды – крупные, прожорливые, активные животные – должны легко поддаваться пищевому подкреплению. Я понаблюдала за работой этой женщины и выяснила вот что. Хотя она постепенно добивалась успеха в формировании определенного движения, каждый раз она давала панде целую морковку. Панда радостно поедала сладкую морковку. В результате, за пятнадцать минут тренировки животное получало только три подкрепления (да и морковь ему порядком надоела). В качестве подкрепления вполне можно было использовать небольшой ломтик морковки.

В целом подкрепление должно быть небольшим, но достаточным, чтобы заинтересовать животное, – пара зернышек кукурузы для цыпленка, маленький кубик мяса для кота, половинка яблока для слона. Любимое лакомство следует отмерять еще более скупо – чайная ложка овса для лошади, к примеру. Смотрители Национального зоопарка обучили своих белых медведей массе полезных вещей – например, переходу в другую клетку по команде. В качестве подкрепления каждый раз они давали им по одной изюминке.

Золотое правило любого тренера заключается в том, что, проводя в день всего один сеанс, можно подкрепить желательное поведение примерно четвертью дневного рациона животного, а остальную пищу отдать просто так. Если вы планируете провести в течение дня три или четыре сеанса, то разделите обычный рацион на восемьдесят подкреплений. В течение сеанса выдайте животному двадцать-тридцать подкреплений. Восемьдесят подкреплений – это максимальное количество, способное поддержать интерес субъекта в течение дня. (Может быть, поэтому в кассете обычно помещается именно восемьдесят слайдов. Я сама не раз огорченно вздыхала, когда лектор просил помощника поставить вторую кассету.)

Трудность задачи обычно влияет на размер подкрепления. В парке «Си Лайф» за «олимпийские» достижения (прыжки на высоту двадцати двух футов) выдавали каждому из наших китов по большой макрели. Животные просто отказывались делать это за обычное подкрепление, состоявшее из двух маленьких снетков. У людей же вознаграждение за тяжелую работу не всегда бывает более высоким. И как же нам это не нравится, когда тяжелую работу приходится выполнять именно нам.

Джекпот

Одним из самых полезных приемов пищевого или иного положительного подкрепления в отношении людей или животных является джекпот.

Джекпот – это значительное подкрепление, порой раз в десять больше обычного, которое является для субъекта полным сюрпризом.

Когда-то я работала в рекламном агентстве. На Рождество у нас устраивалась вечеринка, а, кроме этого, мы в неформальной обстановке отмечали завершение большого проекта или заключение контракта с новым важным клиентом. Но наш президент имел обыкновение устраивать в течение года пару неожиданных вечеринок. В разгар рабочего дня он появлялся в офисе, кричал, чтобы все бросали работу. Приемная закрывалась, и в конференц-зал чередой тянулись музыканты, бармены, официанты, несли шампанское и копченую семгу. Все это устраивалось для сотрудников без всякого повода. Это был настоящий джекпот для пятидесяти человек. И такая политика приносила плоды. Я думаю, что замечательным моральным климатом наше агентство было обязано именно своему президенту.

Джекпот можно использовать для стимулирования неожиданного прорыва. Так поступил один мой знакомый тренер. Когда молодая лошадь впервые выполнила сложный маневр, наездник соскочил с нее, снял седло и уздечку и выпустил лошадь на манеж. Джекпотом стала полная свобода, и это способствовало закреплению нового поведения.

Удивительно, но один джекпот может оказаться весьма эффективным в работе с недоверчивым, пугливым и сопротивляющимся субъектом, который вообще не демонстрирует желательного поведения. В парке «Си Лайф» мы использовали результаты исследований, проводящихся на военно-морском флоте. Мы пытались обучить дельфина новым реакциям вместо уже усвоенных. Мы работали с очень послушным дельфином по кличке Хоу, который очень редко демонстрировал новые реакции. Не получая подкрепления за проделанный трюк, он переставал работать. Во время одного из сеансов он двадцать минут ничего не делал. В конце концов тренер выдал ему две рыбки просто так. Впечатленный такой щедростью дельфин начал работать очень активно. Очень скоро он сделал движение, которое нужно было подкрепить. На следующих сеансах мы достигли огромного прогресса.

То же самое произошло и во время моей работы с дельфинами. Когда мне было пятнадцать, то наибольшее удовольствие мне доставляли уроки верховой езды. В конюшне, где я занималась, продавали абонементы на десять занятий. На свои карманные деньги я могла себе позволить только один абонемент в месяц. Тогда я жила со своим отцом, Филиппом Уайли, и мачехой, Рикки. Хотя они были очень добры ко мне, в переходном возрасте я была не самой послушной дочерью. Однажды вечером мои любящие и терпеливые родители сказали, что ужасно устали от моего поведения и поэтому решили вознаградить меня.

Они подарили мне новый абонемент в школу верховой езды. Они не пожалели сил и времени, чтобы съездить и купить его. Надо же! Незаслуженный джекпот! Насколько я помню, я исправилась тут же. И Рикки Уайли подтвердила, что это действительно было так (я беседовала с ней, когда писала эту книгу).

Почему незаслуженный джекпот оказывает такое резкое и длительное воздействие, я толком не понимаю. Может быть, кто-нибудь когда-нибудь защитит докторскую диссертацию на эту тему и объяснит нам этот феномен. Я помню, что абонемент в школу верховой езды избавил меня от чувств тоски и обиды. Мне кажется, что дельфины чувствовали то же самое.

Условное подкрепление

В работе, и особенно в работе с пищевыми подкреплениями, часто случается так, что дать подкрепление в момент желательного поведения просто невозможно. Уча дельфина прыгать, я не имею возможности дать ему рыбу, когда он находится в воздухе. Если после каждого прыжка, то есть после неизбежной задержки, кидать ему рыбу, он сумеет связать прыжки и получение пищи и станет прыгать чаще. Но животное не может понять, какой именно аспект прыжка мне понравился. Высота? Траектория? Может быть, погружение с брызгами? Потребуется немало повторений, прежде чем животное поймет, какой именно прыжок мне нужен. Чтобы решить эту проблему, мы стали использовать условные подкрепления.

Условное подкрепление – это первоначально бессмысленный сигнал (звук, вспышка, движение), который подается перед или во время подкрепления.

В работе с дельфинами мы использовали в качестве условного подкрепления полицейский свисток. Его легко услышать даже под водой, и при его использовании руки остаются свободными для подачи других сигналов и бросания рыбы. С другими животными я часто пользовалась «сверчком», маленькой игрушкой, которая при нажатии издает звук «клик-клик». Иногда я использовала конкретную похвалу, приберегаемую только для условного подкрепления. «Хорошая собака». «Хороший пони». Школьные учителя тоже часто пользуются некими ритуализованными и тщательно подобранными похвалами («Хорошо», «Очень хорошо»), и дети ожидают подобных слов.

Условные подкрепления окружают нас постоянно. Мы с радостью слышим телефонный звонок и видим новые письма в почтовом ящике, хотя очень часто звонки не доставляют нам удовольствия, а большая часть писем оказывается обычным спамом. Но в нашей жизни было немало случаев, которые помогли нам связать звонки и конверты с чем-то приятным. Нам нравится рождественская музыка, нас пугает запах в приемной дантиста. Мы украшаем свой дом картинами, тарелками и сувенирами не только потому, что они красивы или полезны, но и потому, что они напоминают нам о счастливых временах или дорогих людях. Все это – условные подкрепления.

Практическая дрессировка с использованием положительного подкрепления почти всегда должна начинаться с определения условного подкрепления. Перед началом выработки конкретного поведения, хотя животное еще не сделало ничего особенного, вы должны научить его понимать значимость условного подкрепления, сочетая его с пищей, лаской или иным реальным подкреплением. Вы сразу поймете (по крайней мере, при работе с животными), когда субъект начинает распознавать ваш одобрительный сигнал. Животное воспринимает условное подкрепление и начинает искать подкрепление реальное. После усвоения условного подкрепления у вас есть реальный способ дать понять животному, что именно вам нравится в его поведении. Так что вовсе не обязательно быть доктором Дулиттлом, чтобы уметь разговаривать с животными. Усвоенным подкреплением вы можете «сказать» очень многое.

Условные подкрепления могут быть очень значимыми. Я видела, как морские млекопитающие даже после насыщения долго работали ради условного подкрепления. Лошади и собаки работали более часа при наличии очень малого количества первичных (то есть реальных) подкреплений. Люди, конечно, могут бесконечно работать ради денег, которые по сути своей являются обычными условными подкреплениями – жетонами, на которые можно купить товары. Много работают даже те, кто уже заработал денег больше, чем сможет потратить. Такие люди впадают в настоящую зависимость от условного подкрепления.

Можно сделать условное подкрепление еще более сильным, сочетая его с несколькими реальными подкреплениями. Предположим, что в данный момент ваш объект не хочет еды. Но если тот же самый подкрепляющий звук или слово сознательно связывается с едой или другими удовольствиями, он сохраняет свою полезность. Мои кошки слышат фразу: «Хорошая девочка!», когда я насыпаю им еду, глажу их, впускаю или выпускаю из дома, когда они выполняют маленькие трюки и получают за них вознаграждение. Следовательно, я могу использовать ту же фразу в качестве подкрепления, сгоняя кошку с кухонного стола. И при этом мне не потребуются подкрепления реальные.

Деньги потому являются для нас таким сильным подкреплением, что их можно совместить с чем угодно. Это исключительно обобщенное условное подкрепление.

Еще одно очень важное правило.

Сформировав условное подкрепление, нужно быть очень осторожным, чтобы не использовать его всуе, то есть не рассеивать его силу.

Дети, которые катаются на моих уэльских пони, очень быстро учатся произносить фразу «Хороший пони!» только тогда, когда нужно подкрепить поведение. Если они хотят выразить любовь и нежность, то пользуются любыми другими словами. Однажды дети заметили, что ребенок, только что присоединившийся к группе, гладит лошадку по морде и говорит: «Ты – мой хороший пони!» Они очень удивились: «Зачем ты ему это говоришь? Он же ничего не сделал!» Точно так же можно и нужно общаться с детьми (супругами, родителями, любимыми и друзьями).

Выражайте свою любовь и внимание вне связи с конкретным поведением любыми словами. Но выделите определенную фразу, сделав ее условным подкреплением, и свяжите ее с чем-то реальным.

В счастливой семье происходит множество событий, заслуживающих похвалы. Поэтому здесь происходит постоянный обмен подкреплениями. Однако ложная или бессмысленная похвала может быстро превратиться в ничего не значащий набор слов и утратить свою силу. Такую неискренность чувствуют даже маленькие дети.

Клик!

Тренеры, работающие с морскими млекопитающими, пользуются условным подкреплением (обычно свистком) в обучении китов, дельфинов, тюленей и белых медведей. Эту концепцию впервые применил в дельфинариях в 1960-е годы Келлер Бреланд, ученик Б. Ф. Скиннера. Бреланд назвал свисток «мостовым стимулом», потому что этот сигнал не только информировал дельфина о том, что он только что заслужил рыбу, но еще и заполнял промежуток времени между важным событием, то есть желательным поведением, и возвращением в бассейн. Усвоив этот сигнал, дельфины сразу же подплывали к бортику за заслуженной наградой.

Бихевиористская литература подтверждает важность этих аспектов условного подкрепления. Но со временем были открыты новые преимущества этого метода. В 1990-е годы многие дрессировщики стали использовать условное подкрепление. Те же приемы стали использовать хозяева собак (см. главу 6). Поскольку владельцы собак применяют металлический кликер в пластиковом корпусе, обучение собак стали называть «кликер-тренингом».

Звук, используемый в кликер-тренинге, является не только условным подкреплением и мостовым стимулом между зарабатыванием и получением пищи. Этот сигнал выполняет и другие функции. Во-первых, он устанавливает то, что Огден Линдсли назвал «событийным маркером». Благодаря ему животное точно понимает, какое именно поведение является желательным. Но у сигнала есть и другие значения. Он передает контроль в руки, лапы, ласты или в то, что есть у объекта обучения. Через определенное время объект не просто повторяет желательное поведение, но еще и демонстрирует намерение: «Эй! Я заставил тебя кликнуть! Посмотри на меня, я собираюсь сделать это снова!» Кликер-тренеры называют этот момент «загоранием лампочки». Он чрезвычайно важен и для тренера, и для ученика.

Эллен Риз указала мне на то, что условное подкрепление в кликер-тренинге является также завершающим сигналом. Он означает «работа сделана». Как говорит Гэри Уилкс: «Клик завершает поведение». Такой сигнал является подкреплением сам по себе. Но это порой шокирует традиционных тренеров. Сигнал не кажется им естественным. Им странно, что для того, чтобы научить собаку держать палку, нужно кликнуть, когда она ее только возьмет, а потом ей можно позволить бросить палку и насладиться заслуженной наградой.

Еще одно преимущество маркерных сигналов заключается в том, что их можно использовать для передачи конкретной информации. Полицейский Стив Уайт рассказал мне, что как-то раз послал свою немецкую овчарку искать брошенный предмет, который упал на верхушку шестифутового куста. Собака долгое время бесплодно обнюхивала землю. Когда же она подняла голову, Стив кликнул. Собака втянула в себя воздух, насторожилась и стала искать в том месте, куда и упал предмет. Она даже поднималась на задние лапы, чтобы лучше чувствовать воздух. Без всякой помощи со стороны Стива собака нашла нужный предмет, упавший на густой кустарник, и достала его.

Сигнал продолжения

Интересно то, что при общении с собакой Стив использовал подкрепление, которое не являлось сигналом завершения. Это был сигнал продолжения. Сигнал подкрепил «высокое» обнюхивание, и желательное поведение продолжалось до тех пор, пока потерянный предмет не был найден. В первом издании этой книги я писала о том, что условное подкрепление можно использовать несколько раз, не сочетая его с подкреплением реальным. Я писала так, потому что в парке «Си Лайф» мы не раз поступали так с дельфинами, формируя длительное поведение или поведенческие цепочки. В то время я не понимала, что на самом деле мы использовали два (по меньшей мере) условных подкрепления или маркерных сигнала: свисток означал все вышесказанное («Правильно, хорошо, пища тебя ждет, иди получи свое лакомство, работа сделана»), а второй, приглушенный, свисток означал совсем другое («Это хорошо, но работа еще не закончена»).

Многие начинающие кликер-тренеры, с которыми я работала в 90-е годы, были теми, кого писатель Морган Спектор называет «перекрестными» тренерами (то есть людьми, опытными в тренинге, основанном на коррекции, но пытающимися перейти к системе положительного подкрепления). Я обнаружила, что они слишком часто используют кликеры бесцельно, из-за чего ценность сигнала недопустимо снижается. Необходимо усвоить главное правило – «один клик – одно угощение». Только так можно эффективно сформировать желательное поведение.

Однако в реальной жизни возникает множество ситуаций, в которых очень полезен может быть промежуточный подкрепляющий стимул. Так произошло с собакой Стива Уайта. В такой ситуации можно использовать иной подкрепляющий стимул, который говорит ученику: «Все хорошо, продолжай в том же духе». Интересно, что сигнал продолжения не должен быть непосредственно связан с первичным подкреплением. Просто начните вставлять его перед завершающим кликом, и ученик быстро поймет, что он ведет к реальному подкреплению.

Затем вы можете включить воображение и использовать его в качестве информативного маркерного сигнала внутри цепочки, не разрывая ее. Например, на соревнованиях по аджилити собак друг за другом пускают на полосу препятствий на время. Владелец должен дать понять собаке, какое препятствие нужно преодолеть следующим. Причем делается это в крайней спешке. Я видела, как собака преодолевала одно препятствие, а потом замирала в недоумении, потому что не понимала, что делать дальше. Бросаться в туннель или прыгать? Собака недоуменно крутила головой. Хозяин крикнул: «Да», и собака взяла барьер. Она правильно поняла хозяина и быстро прошла всю дистанцию.

Как и в случае с сигналом завершения, неважно, какой стимул вы используете для продолжения действий. Это может быть кликер, свисток, окрик или движение руки. Важно, чтобы стимул не являлся сигналом бессмысленного подбадривания, который лишь отвлекает животное или случайно подкрепляет нежелательное поведение. Нужно сформировать прочное и точно используемое условное подкрепление.

Условное отрицательное подкрепление

Правильно поданное условное положительное подкрепление говорит ученику: «То, что ты сейчас делаешь, хорошо и правильно. Это действие принесет тебе пользу, так что продолжай в том же духе». Но можно также установить отрицательный условный сигнал. Такое действие говорит ученику: «То, что ты сейчас делаешь, нехорошо. Если ты не прекратишь, с тобой случится что-то плохое».

Условные отрицательные подкрепления более эффективны, чем угрозы. Некоторые субъекты – и в частности, кошки – не реагируют на крики и выговоры. Но моей подруге удалось совершенно случайно отучить кота от дурной привычки драть диван, сделав условным раздражителем слово «Нет!». Как-то раз, готовя обед, моя подруга уронила большой медный поднос, который упал прямо рядом с котом. Когда поднос падал, подруга воскликнула: «Нет!» – а после этого слова поднос приземлился на пол со страшным звоном. Кот ужасно перепугался, подскочил, шерсть на нем встала дыбом. Когда в следующий раз подруга заметила, что кот дерет диван, она громко крикнула: «Нет!» Испуганный кот тут же умчался прочь. Достаточно было двух повторений, чтобы раз и навсегда положить конец вредной привычке.

Выговоры являются неотъемлемой частью нашего существования. Использование в качестве основного средства обучения положительного подкрепления вовсе не означает, что вы не можете при необходимости использовать и отрицательные подкрепления. Это жизненно необходимо, например, когда ребенок пытается засунуть шпильку в электрическую розетку. Однако часто мы совершаем две ошибки: во-первых, не учитываем побочный эффект, который оказывает отрицательное подкрепление на ученика (см. главу 4, «Наказание»). И, во-вторых, используем выговоры и наказания, не устанавливая предупреждающего сигнала, то есть условного отрицательного подкрепления.

Например, любой, кто считает необходимым использовать электрошокер при воспитании собаки, должен всегда говорить «нет», когда собака что-то делает неправильно. После этого нужно сделать паузу, прежде чем нажать на кнопку шокера, чтобы собака имела возможность избежать отрицательного подкрепления, изменив свое поведение. Простое нажатие на кнопку без предупредительного сигнала превратит ваше действие в наказание, воздействие которого на будущее поведение и на готовность собаки подчиняться вашим приказам абсолютно непредсказуемо. Третья распространенная ошибка – продолжать нажимать на кнопку даже тогда, когда собака уже перестала делать то, что вам не нравилось. Таким образом вы наказываете ее за оба вида поведения – неправильное и правильное.

Неумение использовать условное отрицательное подкрепление повышает количество реальных отрицательных подкреплений, которые используются в коррекционной тренировке. Это значительно замедляет процесс обучения. Традиционные дрессировщики собак и лошадей иногда тратят на выработку желаемого поведения гораздо больше времени, чем те, кто использует положительное подкрепление. Порой время дрессировки увеличивается на несколько месяцев, а то и лет. Это происходит не только потому, что они полагаются исключительно на наказание (этот прием останавливает поведение, а не дает начало новому), но еще и потому, что они используют реальные отрицательные подкрепления, не сформировав условного отрицательного подкрепления. В результате требуются сотни повторений, прежде чем животное поймет, чего же от него хотят.

Среди дрессировщиков собак в последнее время приобрел популярность особый вид условного отрицательного подкрепления. Речь идет о маркере отсутствия вознаграждения. Обычно таким маркером служит слово «Неправильно», произнесенное нейтральным тоном. Идея заключается в том, что, когда собака пытается вести себя неправильно, чтобы понять, чего же вы хотите, вы помогаете ей, сообщая, что именно она делает не так. Вы формируете сигнал, который говорит животному: «Эти действия не будут вознаграждены».

Б. Ф. Скиннер определял отрицательное подкрепление, как лишение чего-то желанного. В этом смысле сигнал «неправильно» является условным отрицательным подкреплением, поскольку он означает недоступность вознаграждения.

Занимаясь дрессировкой собак, я сталкивалась с ситуациями, в которых сигнал «неправильно» был очень полезен. Если ваша собака демонстрирует широкий набор полностью сформированных видов поведения, то есть является сложным объектом для дрессировки, вы можете использовать сигнал «неправильно» в качестве намека на изменение поведения. В данной ситуации он означает: «Этот путь никуда не приведет. Попробуй что-нибудь другое».

Этот прием работает только в том случае, если вы уже использовали положительные подкрепления различных видов поведения, а ваша собака активно ищет новые пути, чтобы заставить вас кликнуть или дать ей реальное подкрепление. Люди испытывают трудности с условным отрицательным подкреплением, когда используют его с неопытной собакой, которая не понимает, чего от нее хотят.

Прикажите собаке сесть, а если она этого не сделает, скажите: «Неправильно». Если собака уже понимает, что этот сигнал означает отсутствие вознаграждения, она поймет, что вы наказываете ее за то, что она не села. Но это еще не означает, что она действительно сядет. На самом деле результат будет таким же, как и при любом другом наказании – то есть абсолютно непредсказуемым. Собака может вообще перестать реагировать на слова и убежать или бросить все и начать искать собственные подкрепления, то есть вести себя неподобающе – лаять, тянуть поводок, обнюхивать землю, скрести, обращать внимание на все, что угодно. Поэтому условное и реальное отрицательное подкрепление лучше использовать тогда, когда вам необходимо прекратить нежелательное поведение, а для выработки новых навыков пользуйтесь положительным подкреплением.

Режимы подкрепления

Существует распространенное заблуждение, что если вы начали вырабатывать какое-то поведение с помощью положительного подкрепления, то должны продолжать пользоваться этим методом всю жизнь. А если перестать использовать этот метод, желательное поведение прекратится. На самом деле это не так. Постоянное подкрепление необходимо только на этапах обучения.

Вы можете постоянно хвалить малыша за то, что он научился пользоваться горшком. Но как только поведение закреплено, дальше оно проявляется автоматически. Мы подаем (или должны подавать) массу подкреплений начинающему. Когда ребенок учится кататься на велосипеде, вы наверняка постоянно повторяете ему: «Правильно, а теперь прямо… Ты сделал это, хорошо!» А теперь представьте, насколько глупо вы будете выглядеть, если продолжите хвалить ребенка, который уже отлично катается на велосипеде. Да и ребенок подумает, что вы сошли с ума.

Чтобы заученное поведение надежно закрепилось, вовсе не нужно подкреплять его каждый раз. Наоборот, очень важно не подкреплять поведение на регулярной основе, а использовать подкрепление лишь от случая к случаю, случайно и непредсказуемо.

Психологи называют это вариативным режимом подкрепления. Вариативный режим намного более эффективно поддерживает поведение, чем постоянный и предсказуемый. Один психолог объяснил мне это так. Если вы купили новую машину, которая резво трогается с места, и в один прекрасный момент она почему-то не завелась, вы несколько раз попробуете повернуть ключ, но потом поймете, что что-то сломалось, и позвоните механику. Поворачивание ключа в отсутствие ожидаемого немедленного подкрепления быстро прекращается. Если же у вас старая машина, которая почти никогда не заводится с первой попытки, и для того, чтобы ее завести, требуется длительное время, вы будете поворачивать ключ снова и снова. Поворачивание ключа длительно подкреплялось в вариативном режиме. И поэтому это прочно закрепленное поведение.

Если я буду давать дельфину рыбу за каждый прыжок, животное станет прыгать невысоко и вяло – лишь бы получить рыбу и отделаться от меня. Если я прекращу давать рыбу, дельфин быстро перестанет прыгать. Но можно поступить иначе. Дельфин научился прыгать за рыбу. Теперь я начинаю подкреплять первый, третий и последующие прыжки случайным образом. Тогда желательное поведение закрепится более прочно. Не получивший вознаграждения дельфин станет прыгать более часто, надеясь вытянуть счастливый билет, а энергичность прыжков может даже возрасти. Это позволит мне избирательно подкреплять лучшие прыжки. Используя вариативный режим, я сформирую требуемое поведение.

Но даже профессиональные дрессировщики не всегда правильно используют вариативный режим положительного подкрепления. Понять и принять эту концепцию бывает нелегко.

Мы понимаем, что не нужно наказывать за неправильное поведение, если это поведение прекратилось. Но мы не понимаем, что необязательно и даже нежелательно вознаграждать правильное поведение постоянно.

Стремясь закрепить дисциплину животного с помощью положительного подкрепления, мы оказываемся менее уверенными в себе.

Привлекательность вариативного режима лежит в основе всех азартных игр. Если бы каждый раз, когда вы опускали мелкую монетку в игровой автомат, вам выпадала монетка более крупного достоинства, вы быстро заскучали бы. Да, вы обогатитесь, но вам будет скучно. Люди любят игровые автоматы именно потому, что предсказать результат практически невозможно. Вы можете ничего не выиграть, выиграть маленькую сумму или получить огромный выигрыш. Невозможно понять, в какой момент будет получено подкрепление (это может случиться даже в самый первый раз). Почему некоторые люди впадают в игровую зависимость, а некоторые – нет, это другой вопрос. Но для тех, кто попался на крючок, привлекательным является именно вариативный режим подкрепления.

Чем дольше сохраняется вариативный режим, тем прочнее он закрепляет поведение. Но длительность режима работает против вас в тех случаях, когда вы стремитесь устранить определенный стандарт поведения.

Неподкрепленное поведение угасает само собой. Но если поведение время от времени подкрепляется, пусть даже спорадически – одна сигарета, одна рюмка, одна уступка капризному ребенку или нудному партнеру, – оно не угаснет, а, напротив, прочно закрепится.

И добьетесь вы такого нежелательного результата с помощью длительного вариативного режима. Так человек, бросивший курить и случайно позволивший себе одну сигарету, может снова превратиться в отъявленного курильщика за одну минуту.

У каждого из нас есть знакомые, которые почему-то продолжают жить с супругами или любовниками, хотя те относятся к ним несправедливо. Мы привыкли считать, что такое случается только с женщинами, которые влюбляются в грубых, невнимательных, эгоистичных и даже жестоких людей. Но это происходит и с мужчинами. Мы все знаем таких людей. Даже после развода или расставания с неподходящим партнером они ухитряются найти себе нового точно такого же.

Являются ли эти люди по каким-то глубинным психологическим причинам постоянными жертвами? Возможно. Но не являются ли они жертвами длительного вариативного режима? Вступив в отношения с обаятельным, сексуальным, веселым и внимательным человеком, который со временем превращается в настоящего монстра, хотя время от времени все же проявляет свою хорошую сторону, вы живете надеждой на те редкие моменты, когда вам удается получить столь желанное положительное подкрепление: обаяние, сексуальность, внимание и заботу.

С точки зрения здравого смысла это кажется странным, но с точки зрения дрессировщика, все абсолютно ясно. Чем более редкими и непредсказуемыми будут такие моменты, тем более сильное воздействие они окажут на вас и тем прочнее укрепится поведение. Более того, легко понять, почему человек, когда-то находившийся в таких отношениях, стремится вступить в них вновь. Отношения с нормальным партнером, который почти всегда дружелюбен и нежен, кажутся ему скучными. Ему недостает редких, долгожданных и оттого гораздо более сильных эмоций, связанных с вариативным подкреплением.

А теперь взглянем на то же состояние с точки зрения манипулятора: «Она/он будет у меня из рук есть и делать все, что я захочу, только ради моего комфорта, пока я буду давать ей/ему то, чего она/он хочет… иногда». Так сутенеры держат в ежовых рукавицах своих проституток. Это действительно очень мощное средство, но стоит жертве понять, что «обаяние» действует только по причине редкости и случайности своего проявления, как она или он тут же смогут выйти из такого рода отношений и найти себе нормального партнера.

Исключения из правила вариативного подкрепления

Не следует прибегать к вариативному режиму в процессе закрепления конкретного поведения, когда поведение связано с решением определенных задач или выполнением тестов путем выбора.

В процессе обучения послушанию собакам предлагают выбрать из массы различных предметов те, которые держали в руках их хозяева. Каждый раз, когда собака сделает правильный выбор, ее нужно хвалить, чтобы она знала, что нужно делать в следующий раз. В тестах на различение – например, при выборе более высокого из двух звуков – ученик должен получать подкрепление при каждом правильном ответе. Только так он будет понимать, какой вопрос ему задан. (Разумеется, в такой ситуации нужно использовать условное подкрепление.) Разгадывая кроссворд или собирая пазл, мы получаем подкрепление своим правильным предположениям, поскольку только они «подходят» к данному месту. Если бы при собирании пазла в любом месте можно было использовать разные фрагменты, то вы не получили бы положительного подкрепления верного выбора. А это и есть обратная связь, которая необходима в большинстве ситуаций выбора путем проб и ошибок.

Долговременные программы поведения

Кроме вариативных режимов можно установить также фиксированный режим подкрепления, при котором субъект ради получения подкрепления должен работать в течение определенного периода времени или определенное количество раз продемонстрировать желательное поведение.

страницы: 1 2 3