Валидность в психологии. Валидность методики, виды валидности. Корреляционный анализ как один из приемов определения надежности и валидности

Человек пользуется различными методиками и инструментами, чтобы проверить или измерить какое-то качество. Насколько эта методика и инструмент способны качественно выдать результаты, обозначает их валидность. Что обозначает данное понятие в психологии? Какие существуют виды валидности? В психологии обычно данное свойство применимо к тестам и методикам, которыми пользуются специалисты.

Что такое валидность?

У рассматриваемого понятия существует много определений. Что такое валидность? Это пригодность и обоснованность применения какой-то методики или результата в конкретной ситуации. Прикладное значение данного слова – степень соответствия результатов и методик поставленным задачам.

Валидность – это измерение другого показателя, которое измеряет конкретные качества. Таким образом, методика направлена на измерение конкретного качества, например, интеллекта, а ее валидность должна показывать, насколько хорошо данная методика помогает в получении результатов.

Другим словом валидность можно назвать достоверностью. Она измеряет те тесты и методики, которые занимаются измерениями определенных психологических качеств. Чем лучше они измеряют те качества, которые измеряют, тем выше их валидность.

Валидность становится важной в двух случаях:

Когда некая методика разрабатывается.
Когда некая методика показывает результаты, и необходимо установить, насколько качественны данные результаты.

Таким образом, валидность – это характеристика, которая указывает пригодность конкретной методики для измерения какого-то качества и полезность, качественность, эффективность данной методики.

Обычно используется несколько видов валидности, чтобы провести проверку конкретного теста или методики. Здесь также происходит сравнение показателей, которые даются различными инструментами. Существует множество способов измерения того или иного психологического качества или характеристики. Чаще психологами будет использоваться та методика, которая дает более достоверные результаты. Это и будет показывать ее высокую валидность.

Вместе с валидностью часто рассматривается такое понятие, как надежность. Методики и тесты должны быть надежными, то есть они должны быть постоянными, достоверными. Экспериментатор должен быть уверен в том, что он рассматривает именно то качество, которое он желает рассмотреть. Вот почему надежность не всегда может быть валидной, однако валидность всегда должна быть надежной.

Валидность в психологии

Валидность используется во многих сферах жизни, где происходят измерения различных показателей. В психологии валидность также становится нужной, особенно в экспериментальной психологии. Валидность в психологии – это:

уверенность экспериментатора в том, что он измеряет нужное ему качество;
достоверность показателей, которые измеряют данное качество.

Если читатель хоть раз проходил психологические тесты, то он знает о внутреннем желании получить конкретный ответ на поставленный вопрос. Валидность теста показывает экспериментатору конкретный результат, которого он достигает путем тестирования. Здесь стоит конкретная задача, ответ на которую он должен получить после совершения всех нужных действий.

Методики и тесты должны быть полезными и достоверными, что и измеряется путем их валидности.

Существует три способа проверки на валидность:

Оценивание содержательной валидности – соответствие результатам оценивания испытуемого реальным качествам, которые проявляются в действительности. Здесь используется такое понятие, как лицевая валидность – человек должен видеть реальную связь между содержанием самой методики и ее результатами и действительностью, в которой проявляется измеряемое качество.
Оценивание конструктной валидности – определение того, что методика вычисляет научно обоснованные и заданные конструкты. Конвергентная валидизация позволяет использовать несколько методик, которые рассматривает схожие характеристики и дают более точные результаты рассматриваемого качества. Дискриминантная валидизация исключает другие методики, которые рассматривают качества, не имеющие корреляции с нужным качеством.
Оценивание критериальной валидности – это соответствие результатам ожидаемым показателям, которые выявляются другими способами. Здесь используется прогностическая валидность, которая помогает спрогнозировать дальнейшее поведение.

Виды валидности

Существует несколько видов валидности, которые рассмотрим ниже:

Внешняя валидность – обобщение вывода ситуации, популяции, независимых переменных. Она делится на:

Операциональную валидность.
Конструктную валидность – объяснение поведения человека в момент прохождения теста.

Внутренняя валидность – изменение в процессе эксперимента под влиянием неизменяемых факторов.
Дифференциальная валидность.
Инкрементная валидность.
Экологическая валидность – показатель того, что человек способен к совершению различных действий, которые в одной ситуации могут быть успешными, а в другой нет.

Данная классификация используется экспериментальной психологией. Организационной психологией и психодиагностикой используется другая классификация:

Конструктная валидность. Она делится на:

Конвергентную валидность.
Дивергентную валидность.

Критериальная (эмпирическая) валидность – подсчет корреляции по баллу по тесту внешнему параметру, который был выбран в качестве валидного показателя. Она делится на:

Текущую валидность – изучение параметра в настоящем времени.
Ретроспективную валидность – состояние или событие, которое было в прошлом.
Прогностическую валидность – прогноз поведения, качества.

Содержательная валидность – используется в экспериментах, где рассматривается некоторое взаимодействие, деятельность. Имеет подвид:

Очевидная валидность.

Другими видами валидности являются:

Априорная.
Конгруэнтная.
Сопутствующая.
Конструктивная.
Консенсусная.
Факториальная.
Теоретическая и пр.

Что такое валидность теста?

Многие люди проходят тесты. Есть специальные психологические тесты, применяемые психологами, и другие, бульварные тесты. Что такое валидность теста, которая является важным ее критерием? Это показатель соответствия характеристики, качества, свойства к тесту, который их измеряет.

Тесты бывают разными. Они используются для измерения психофизиологических параметров человека. Самым высоким показателем валидности остается 80%. Полезность применения тестов становится в том случае, когда они позволяют получить точные данные по тем или иным конкретным характеристикам. Существует несколько подходов при изучении валидности теста:

Конструктивная валидность, которая позволяет более глубоко изучить качества человека в ситуации, деятельности, системе.
Валидность за критерием – изучение параметра в настоящем времени и прогнозирование его в будущем.
Содержательная валидность – соответствие психологических конструктов, их многообразие.
Прогностическая валидность – предсказывает развитие конкретного качества в будущем, что является затруднительным, поскольку оно может развиваться по-разному у разных людей.

Пока надежность и валидность теста не определены, его не применяют в психологической практике. Многое зависит от того, в каких областях применяются тесты. Есть учебные, профессиональные и прочие тесты, которые применяются в отдельных учреждениях для прогнозирования и выявления характеристик претендентов.

На сайте психологической помощи сайт вы также можете пройти тесты, которые уже обладают высокой валидностью и показывают достоверные результаты.

Что такое валидность методики?

Что такое валидность методики? Это показатель, который обозначает, занимается ли рассматриваемая методика изучением того качества, характеристики, для которой она предназначена. При этом делается акцент на том, что испытуемый, который проходит тестирование, может иначе видеть и характеризовать самого себя. Вот почему не всегда результаты учитывают мнение людей, которые могут не замечать за собой определенных характеристик.

Валидизацией называется проверка валидности методики. Чтобы определить действенность, эффективность, практичность используемой методики, применяется внешний независимый показатель – качество, которое наблюдается в повседневной жизни. Здесь выделяют 4 типа внешних показателей:

Критерий исполнения – затраченное время, количество работы, уровень успеваемости, рост профессиональных навыков и т. д.
Субъективные критерии – мнение, взгляды, предпочтение, отношение испытуемого к кому- или чему-либо. Здесь применяются анкеты, интервью, опросники.
Физиологические критерии – влияние внешнего мира на психику и организм человека. Здесь измеряются пульс, частота дыхания, симптомы утомления и пр.
Критерий случайности – возможен ли, к примеру, подбор лиц, которые не склонны к несчастным случаям? Изучение влияния определенного случая.

Теоретический поход в измерении валидности методов позволяет распознать, действительно ли технология изучает именно то качество, для которого она была предназначена.

Валидность также определяется встречаемостью изучаемого качества. Хорошо, если оно является распространенным, что и делает методику нужной и полезной. Также важными становятся этические и культурные изменения общества.

Итог

В психологической практике часто используются тесты и методики, которые помогают в изучении личности человека. Здесь речь идет в частности о внутренних параметрах, которые не видны глазом. Качества характера, манера поведения, возможный прогноз на будущее, каким человек будет и какова будет его жизнь, — все это изучается различными тестами и методиками, которые преследуют единый итог – изучение человека.

Итогом успешного определения валидности того или иного инструмента является успешное познание каждого человека, несмотря на то, как он смотрит сам на себя. Люди часто не замечают за собой определенных качеств, редко смотрят на себя трезвым взглядом. Тесты и методики позволяют раскрыть в себе отдельные параметры.

Прогноз валидных тестов и методик – быстрое и качественное познание другого человека с возможностью ему помочь в решении любой психологической проблемы. Это достигается нескоро, однако имеющиеся инструменты уже показали свою эффективность. Обычно данный вопрос интересует лишь тех людей, которые занимаются определением качества тестов и методик. Однако и простым людям будет полезно знать, каким упражнениям следует доверять, а каким нет.

Для того чтобы психолого-педагогический эксперимент был достаточно надежным средством исследования и позволял получать вполне достоверные результаты, которым можно доверять и на основе которых можно делать правильные практические выводы, необходимо, чтобы используемые в нем психодиагностические методы были научно обоснованными. Такими считают методы, отвечающие следующим требованиям: валидность, надежность, однозначность и точность.

Термин «валидность» буквально означает: «полноценный», «пригодный», «соответствующий». Валидность по своей сути - это комплексная характеристика, включающая, с одной стороны, сведения о том, пригодна ли методика для измерения того, для чего она была создана, а с другой стороны, какова ее действенность, эффективность . Проверка валидности методики называется валидизацией.

Есть несколько разновидностей валидности, каждую из которых следует рассматривать и оценивать отдельно, когда стоит вопрос о выяснении валидности психодиагностической методики. Валидность может быть теоретической и практической (эмпирической), внутренней и внешней.

Валидность теоретическая определяется по соответствию показателей исследуемого качества, получаемых с помощью данной методики, показателям, получаемым посредством других методик - таких, с показателями которых должна существовать теоретически обоснованная зависимость. Теоретическую валидность проверяют по корреляциям показателей одного и того же свойства, получаемым при помощи разных методик, опирающихся или исходящих из одной и той же теории.

Валидностъ эмпирическая проверяется по соответствию диагностических показателей реальному поведению, наблюдаемым действиям и реакциям испытуемого. Если, например, с помощью некоторой методики мы оцениваем черты характера у данного испытуемого, то применяемая методика будет считаться практически или эмпирически валидной тогда, когда мы установим, что данный человек ведет себя в жизни именно так, как предсказывает методика, т.е. в соответствии с имеющейся у него чертой характера. По критерию эмпирической валидности методику проверяют путем сравнения ее показателей с реальным жизненным поведением или результатами практической деятельности людей.

Валидностъ внутренняя означает соответствие содержащихся в методике заданий, субтестов, суждений и т.п. общей цели и замыслу методики в целом. Она считается внутренне невалидной или недостаточно внутренне валидной тогда, когда все или часть включенных в нее вопросов, заданий или субтестов измеряют не то, что требуется от данной методики.

Валидностъ внешняя - это примерно то же самое, что и эмпирическая валидность, с той лишь разницей, что в данном случае речь идет о связи между показателями методики и наиболее важными, ключевыми внешними признаками, относящимися к поведению испытуемого.

При создании методики сразу оценить ее валидность трудно. Обычно валидность методики проверяется и уточняется в процессе ее достаточно длительного использования, тем более что речь идет о проверке по меньшей мере с четырех описанных выше сторон.

Не существует какого-то единого универсального подхода к определению валидности. В зависимости от того, какую сторону валидности хочет рассмотреть исследователь, используются и разные способы доказательства. Другими словами, понятие валидности включает в себя разные ее виды, имеющие свой особый смысл.

Существует четыре типа внешних критериев , используемых для доказательства валидности:

1) критерии исполнения (в их число могут входить такие, как количество выполненной работы, успеваемость, время, затраченное на обучение, темп роста квалификации;

2) субъективные критерии (они включают различные виды ответов, которые
отражают отношение человека к чему-либо или к кому-либо, его мнение, взгляды,
предпочтения; обычно субъективные критерии получают с помощью интервью, опросников, анкет);

3) физиологические критерии (они используются при изучении влияния окружающей среды и других ситуационных переменных на организм и психику человека; замеряется частота пульса, давление крови, электросопротивление кожи, симптомы утомления и т.д.);

4) критерии случайностей (применяются, когда цель исследования касается, например, проблемы отбора для работы таких лиц, которые менее подвержены несчастным случаям).

Поиски адекватного и легко выявляемого критерия относятся к очень важным и сложным задачам валидизации.

Существует нескольковидов валидности , обусловленных особенностями диагностических методик, а также временным статусом внешнего критерия:

1) Валидность "по содержанию". Этот прием используется в основном в тестах достижений. Обычно в тесты достижений включается не весь материал, который прошли учащиеся, а какая-то его небольшая часть (3-4 вопроса). Можно ли быть уверенным в том, что правильные ответы на эти немногие вопросы свидетельствуют об усвоении всего материала. На это и должна ответить проверка валидности по содержанию. Для этого проводится сопоставление успешности по тесту с экспертными оценками учителей (по данному материалу). Валидность "по содержанию" также подходит к критериально-ориентированным тестам. Иногда этот прием называют логической валидностью .

2) Валидность "по одновременности", или текущая валидность, определяется с помощью внешнего критерия, по которому информация собирается одновременно с
экспериментами по проверяемой методике. Другими словами, собираются данные, относящиеся к настоящему времени (успеваемость в период испытания, производительность в этот же период и т д.). С ними коррелируют результаты успешности по тесту.

3) "Прогностическая" валидность . Определяется также по достаточно надежному внешнему критерию, но информация по нему собирается некоторое время спустя после испытания. Внешним критерием обычно бывает выраженная в каких-нибудь оценках способность человека к тому виду деятельности, для которой он отбирался по результатам диагностических испытаний. Хотя этот прием наиболее соответствует задаче диагностических методик - предсказанию будущей успешности, применять его очень трудно. Точность прогноза находится в обратной зависимости от времени, заданного для такого прогнозирования. Чем больше проходит времени после измерения, тем большее количество факторов требуется учитывать при оценке прогностической значимости методики. Однако учесть все факторы, влияющие на предсказание, практически невозможно.

4) "Ретроспективная" валидность. Она определяется на основе критерия,
отражающего события или состояние качества в прошлом. Может быть использована для быстрого получения сведений о предсказательных возможностях методики. Так, для проверки того, в какой мере хорошие результаты теста способностей соответствуют быстрому обучению, можно сопоставить прошлые оценки успеваемости, прошлые экспертные заключения и т.д. у лиц с высокими и низкими на данный момент диагностическими показателями.

При приведении данных о валидности разработанной методики важно точно указать, какой вид валидности имеется в виду (по содержанию, по одновременности и т.д.). Желательно также сообщать сведения о численности и особенностях индивидов, на которых проводилась валидизация. Такая информация позволяет пользующемуся методикой исследователю решить, насколько валиден этот прием для той группы, к
которой он собирается его применять. Как и в случае с надежностью, необходимо помнить, что в одной выборке методика может обладать высокой валидностью, а в другой - низкой. Поэтому если исследователь планирует использовать методику на выборке испытуемых, существенно отличающейся от той, на которой проводилась проверка валидности, ему необходимо заново провести такую проверку.

Кроме видов валидности, важно знать критерии валидности . Это основные признаки, по которым можно практически судить о том, является или не является данная методика валидной. Такими критериями могут стать следующие:

1. Поведенческие показатели - реакции, действия и поступки испытуемого в различных жизненных ситуациях.

2. Достижения испытуемого в различных видах деятельности: учебной, трудовой, творческой и других.

3. Данные, свидетельствующие о выполнении различных контрольных проб и заданий.

4. Данные, получаемые при помощи других методик, валидность или связь которых с проверяемой методикой считается достоверно установленной.

Валидность

Одна из важнейших характеристик психодиагностических методик и тестов, один из основных критериев их качества. Это понятие близко к понятию достоверности, но не вполне тождественно.

Проблема валидности возникает в ходе разработки и практического применения теста или методики, когда требуется установить соответствие между степенью выраженности интересующего свойства личности и методом его измерения. Валидность указывает, что именно тест или методика измеряет и насколько хорошо это делает; чем они валиднее, тем лучше отображается в них то качество (), ради измерения коего они создавались. Количественно валидность может выражаться через корреляции результатов, полученных с помощью теста или методики, с другими показателями, - например, с успешностью выполнения соответственной деятельности. Валидность можно обосновать разными путями, чаще всего - комплексно. Применяются также дополнительные понятия валидности концептуальной, критериальной, конструктивной, и прочие виды валидности - со своими способами установления их уровня. Требование валидности весьма важно, и многие нарекания в адрес тестов или иных психодиагностических методик связаны с сомнительностью их валидности. Например, валидность измерения интеллекта зависит:

1 ) от определения понятия интеллекта, являющего ту или иную концепцию этого феномена;

2 ) от состава тестовых заданий, разрабатываемых согласно этой концепции;

3 ) от эмпирических критериев.

Разные концепции требуют различного состава заданий, поэтому важен вопрос валидности концептуальной. Чем больше задания соответствуют данной авторской концепции интеллекта, тем увереннее можно говорить о валидности концептуальной теста. Корреляция теста с эмпирическим критерием указывает на его возможную валидность по отношению к данному критерию. Определение валидности теста всегда требует постановки дополнительных вопросов: валидность для чего? для какой цели? по какому критерию? Итак, понятие валидности относится не только к тесту, но и к критерию оценки его качества. Чем выше коэффициент корреляции теста с критерием, тем выше валидность. Развитие анализа факторного позволило создавать тесты, валидные по отношению к идентифицируемому фактору. Только проверенные на валидность тесты можно использовать в ориентации профессиональной, отборе профессиональном, в исследованиях научных.

Словарь практического психолога. - М.: АСТ, Харвест . С. Ю. Головин . 1998 .

Валидность

Степень нашей уверенности в том, что тест, измерение или эксперимент действительно выполняет ту функцию, для которой они предназначены. Этот весьма общий термин поразному используется в психологии. В процессе эксперимента мы можем оценить:

1. Внутреннюю валидность: действительно ли наблюдаемый эффект является следствием экспериментальной манипуляции? В экспериментах Милгрэма о повиновении авторитету сделанные выводы не могли бы считаться валидными, если бы участники не верили в то, что они действительно получают удар электрическим током.

2. Внешнюю валидность: даже если эксперимент удался, его результаты могут быть неприменимы к другим людям и в других ситуациях. Эксперименты в области социальной психологии часто подвергаются критике, так как они опираются на опыты с американскими студентамидобровольцами и используют лабораторные методы в ходе исследования (см. также Экологическая достоверность).

При определении валидности теста или измерения мы пользуемся одним из ряда следующих критериев:

1. Очевидная валидность: действительно ли тест измеряет то, для чего он предназначен? К примеру, тест иа умственное развитие может выглядеть именно так, как предполагается для тестов подобного рода (высокая степень очевидной валидности), или быть замаскированным под чтото еще (низкая степень очевидной валидности).

3. Конкурентая (совпадающая) валидность: достоверность теста можно проверить. сопоставив его с уже существующими методами измерения. К примеру. новый тест на умственное развитие можно сравнить с другим тестом. валидность которого ужс известна и доказана. Если показатели участников при испытании нового теста совпадают с показателями при провсдснии другого теста, то новый тест тоже обладает валидностью.

4. Прогностическая валидность: можно ли на основе теста предсказывать или рассчитывать показатели по другому критерию? Тесты, используемые с целью отбора, должны обладать хорошей прогностической валидностью.

5. Конструктная валидность: используется ли тест для адекватного измерения теоретического копструкта - т. е. действительно ли тест на умственное развитие определяет коэффициент умственного развития? Если это так, то тест должен обладать особенностями, позволяющими участникам выполнять его в соответствии с их уровнем интеллектуального развития.

Психология. А-Я. Словарь-справочник / Пер. с англ. К. С. Ткаченко. - М.: ФАИР-ПРЕСС . Майк Кордуэлл . 2000 .

Синонимы :

Смотреть что такое "валидность" в других словарях:

валидность - достоверность Словарь русских синонимов. валидность сущ., кол во синонимов: 8 адекватность (18) … Словарь синонимов

Валидность - Валидность ♦ Validité Употребляемый в логике синоним истины, точнее говоря, ее формальный эквивалент. Вывод считается валидным (верным), если представляет собой переход от истинного к истинному (от истинности посылок к истинности заключения) … Философский словарь Спонвиля

Валидность - от фр. valide в статистике законность и достоверность исходной информации, надежность методики сбора, получения данных, в том числе и для экономических исследований. Словарь бизнес терминов. Академик.ру. 2001 … Словарь бизнес-терминов

ВАЛИДНОСТЬ - [Словарь иностранных слов русского языка

ВАЛИДНОСТЬ - (от лат. validus сильный, крепкий) англ. validity; нем. Validitat/Gulltigkeit. Обоснованность и адекватность исследовательских инструментов (операционализированных понятий, измерительных операций и экспериментов). Antinazi. Энциклопедия… … Энциклопедия социологии

Валидность - Надежность информации, отсутствие в ней ошибок из за неточности выбранной методики сбора данных. Терминологический словарь банковских и финансовых терминов. 2011 … Финансовый словарь

ВАЛИДНОСТЬ - (от франц. valide законный, действительный) применительно к исходной статистической информации, используемой в экономических исследованиях: надежность информации, отсутствие в ней ошибок из за неточности выбранной методики сбора данных. Райзберг… … Экономический словарь

валидность - и, ж. validité f. <лат. validus. Действительность, законность, весомость, обоснованность; обладание юридической силой. Комлев 1992. || Способность образовать связную знаковую систему. Барт Что такое критика? // Б. 272. Качество исходной… … Исторический словарь галлицизмов русского языка

Валидность - (англ. validity) мера соответствия того, насколько методика и результаты исследования соответствуют поставленным задачам. В частности, валидность считается фундаментальным понятием экспериментальной психологии и психодиагностики. Как в… … Википедия

Валидность - качество метода психологического исследования, выражающееся в его соответствии тому, для изучения и оценки чего он изначально был предназначен. * * * (лат. validus крепкий, здоровый) надёжность в плане соответствия истине, действительности,… … Энциклопедический словарь по психологии и педагогике

Книги

Личность политика. Теория и методология психологического портретирования , Ракитянский Николай Митрофанович. В настоящем издании обобщен отечественный и зарубежный опыт построения психологического портрета личности политика. Рассматриваются история феномена и понятия психологического портрета и…

Все словари Автомобильный словарь Архитектурный словарь Астрономический словарь Библейская энциклопедия Бизнес словарь Биографический словарь Большой бухгалтерский словарь Джинсовый словарь Кулинарный словарь Медицинский словарь Морской словарь Полиграфический словарь Политический словарь Психологический словарь Религиозный словарь Сексологический словарь Словарь воровского жаргона Словарь географических названий Словарь Даля Словарь Ефремовой Словарь имён Словарь иностранных слов Словарь компьютерного жаргона Словарь курортов Словарь лекарственных растений Словарь логики Словарь мер Словарь моды Словарь молодёжного слэнга Словарь народов Словарь нумизмата Словарь Ожегова Словарь по искусству Словарь по ландшафтному дизайну Словарь по мифологии Словарь русских фамилий Словарь символов Словарь синонимов Словарь фразеологизмов Словарь эпитетов Строительный словарь Толковый словарь Ушакова Финансовый словарь Энциклопедический словарь Энциклопедия Кольера Этимологический словарь Фасмера Этнографический словарь

Что такое Валидность? Значение и толкование слова validnost, определение термина

1) Валидность - (от лат. validus - сильный, крепкий) - англ. validity; нем. Validitat/Gulltigkeit. Обоснованность и адекватность исследовательских инструментов (операционализированных понятий, измерительных операций и экспериментов).

2) Валидность - (от лат. validus - сильный, крепкий) - обоснованность и адекватность исследовательских инструментов (операционализированных понятий, измерительных операций и экспериментов). В. логическая (В. внутренняя) - степень взаимосвязи и взаимной выводимости переменных и индикаторов. В. эмпирическая (В. внешняя) - степень соответствия переменных и индикаторов эмпирическим данным.

3) Валидность - обоснованность и адекватность цели инструментов и методов исследования, понятий и экспериментов.

4) Валидность - - основной показатель качества измерения в социологическом исследовании, отражающий степень соответствия данных измерения объекту измерения.

5) Валидность - - соответствие цели и средств социологического измерения; полностью валидны только бесцельные измерения.

6) Валидность - - мера пригодности применяемых в прикладной социологии методики для решения определенных исследовательских задач, степень соответствия переменных и индикаторов эмпирическим данным, позволяющая получать надежные, репрезентативные и достоверные результаты социологического исследования, избегать систематических ошибок.

7) Валидность - – основная характеристика качества измерения в социологии, одна из составляющих надежности социологической информации. Различают теоретическую (концептуальную) и эмпирическую (валидность по критерию).

8) Валидность - (достоверность) свидетельствует о степени правильности, истинности представленных данных, призванных подтвердить гипотезу.

9) Валидность - - 1. Показатель качества метода, его способность давать результаты, адекватно отражающие изучаемое явление, т.е. именно те результаты, для получения которых он предназначен (В. метода). 2. Мера соответствия теории эмпирическим данным, возможность делать разумно точные предсказания на основании теории (В. теории). 3. Мера соответствия результатов изучаемой реальности, точнее, представлениям о реальности (В. результатов). В данной статье В. обсуждается в первом смысле. В позитивистской науке различают В. измерения, внутреннюю и внешнюю В. экспериментальных процедур и В. статистического вывода. В. измерительных процедур Под измерением понимают процесс связывания теоретического понятия с одной или несколькими латентными переменными, а этих последних - с наблюдаемыми переменными. В классической теории результат измерения включает два не коррелирующих компонента: истинный и ошибочный. В отношении ошибок измерения делаются предположения, при выполнении которых поведение ошибок становится известным. В. измерительной процедуры - мера ее соответствия измеряемому конструкту. Чаще других оценивают критериальную (часто называемую эмпирической), конструктную, конвергентную и дискриминантную В. В качестве вспомогательных методов установления В. используют реферирование литературы по вопросу, экспертные оценки. Критериальная В. измерительной процедуры оценивается по тесноте статистической связи (корреляции) между измеренными результатами и внешним критерием. Так, критериальная В. шкалы лидерства означает, что полученный показатель коррелирует с некоторым независимо полученным показателем, например, социометрическими данными. Указание на критериальную В. предполагает не только сообщение о коэффициенте корреляции между показателями теста и внешним показателем, но также о всех обстоятельствах исследования: как и в какой ситуации был измерен критерий, на какой выборке проводилось исследование и др. Критерии могут быть текущими (измеряемыми одновременно с применением валидизируемой процедуры) и прогностическими. Прогностическая В. высоко желательна для практически ориентированных методов измерения. Недостатками подхода является трудности с подбором критерия и риск измерения невалидного критерия, что существенно снижает полученный коэффициент корреляции. Как оцениваемое поведение, так и критерий могут меняться во времени, а выборки могут быть смещенными. Если бы исследователю удалось найти совершенный критерий, создание измерительной процедуры стало бы избыточным. В этой связи понятен парадокс, сформулированный Дж.Келли: В. метода - это его способность предоставлять и без того известную информацию. Зависимость критериальной В. от свойств критерия, невозможность нахождения удовлетворительного объективного показателя во многих областях знания существенно снижают ценность критериальной В. как показателя качества измерительной процедуры. Конструктная В. устанавливается по статистической связи между показателями данной процедуры и других методик, измеряющих родственный конструкт. Гипотезы о статистической связи формулируются до их проверки, на основании содержательной теории. Конструктная валидизация - длительный процесс, и ни одна эмпирическая корреляция не может гарантировать достоверности измерения. Теоретически постулируется связь между конструктами, оценивается корреляция между индикаторами этих конструктов, на основании полученных данных пересматриваются теоретически ожидаемые связи между конструктами или между конструктами и индикаторами. Подбирается новый конструкт (или новый индикатор, или новая теория о связи между конструктами), и процесс повторяется снова. Оба конструкта могут оказаться неродственными. Так бывает, когда измерительные методы, выступающие под одним и тем же названием, строятся на разных теоретических основаниях. Другие проблемы связаны с ситуациями, когда измеренный показатель, привлекаемый для валидизации процедуры, измеряется недостаточно валидно; один и тот же индикатор одновременно измеряет разные конструкты; ошибки измерения коррелируют между собой. Если исследователь уверен/а в том, что структурная схема корректна (отсутствуют связи между индикаторами и посторонними конструктами, а корреляция между ошибками измерения равна нулю), он/а может найти корреляцию между конструктами, скорректированную на ненадежность индикаторов. Для оценки конструктной В. измерительной процедуры часто используют факторный анализ индикаторов. Под этим именем понимается широкий набор методов снижения размерности данных, когда из множества измеренных переменных извлекается небольшое количество латентных переменных (факторов). Количество и теоретическая интерпретируемость факторов трактуется как мера В. измерительного метода, а факторные нагрузки измеренных переменных - как мера В. индикаторов. Факторная нагрузка - это стандартизованная мера структурной связи между общим фактором (латентной переменной) и индикатором. Ее часто определяют как корреляцию между фактором и переменной. Широко известные методы факторного анализа (например, анализ главных осей) является эксплораторной процедурой, т.е. не позволяет проверять статистических гипотез, а результат анализа существенно определяется техническими решениями, который принимает исследователь. В этом смысле возможности метода как средства валидизации ограничены. Чтобы ослабить произвол при проведении факторного анализа, используют кросс-валидизацию: выборка случайно расщепляется пополам, факторы извлекаются на одной половине выборки, а оправданность и устойчивость факторного решения проверяется на другой половине. Понятия конвергентной и дискриминантной В. введены Д. Кембеллом и Д. Фиске как два взаимосвязанных показателя достоверности метода. Конвергентная В. требует "сходимости" (высокой корреляции) родственных конструктов, дискриминантная В. - отсутствия корреляций между измерениями неродственных конструктов. Более строго эта концепция реализована в подходе, известном под именем "Много черт - много методов", или МЧММ (MTMM - many traits, many methods). Суть его в том, что несколько свойств измеряются несколькими методами. Между показателями одного и того же свойства, измеренного с помощью разных методов, должны быть высокие корреляции, между показателями разных свойств, измеренными с помощью одного метода, - низкие. Третьим условием является превышение первого набора коэффициентов корреляции над вторым. Есть и более строгие статистические методы анализа корреляционной матрицы МЧММ. В последние годы приобрели популярность структурные уравнения, в частности, конфирматорный факторный анализ, который в соответствии с содержательной моделью раскладывает ковариации измерений на компоненты, связанные с влиянием методов, свойств, и ошибки. Полученные структурные коэффициенты интерпретируются как показатели В. В. экспериментального метода Круг понятий, связанных с оценкой В. эксперимента (и результатов эксперимента), был разработан методологами-постпозитивистами в 1960-х (Д. Кэмпбелл, Т. Кук, Дж. Стэнли и др.). В эпистемологической традиции, восходящей к Дж.С.Миллю и связывающей причинность с манипуляцией, истинный эксперимент со случайным распределением испытуемых по условиям рассматривается как единственное средство убедительной проверки каузальных гипотез. С этой точки зрения причинные утверждения в неэкспериментальных науках (социологии) нелегитимны. Предшествование во времени предполагаемой причины (независимой переменной) следствию (зависимой переменной) как одно из условий каузальной связи в эксперименте обеспечивается манипуляцией и измерением ее последствий. Сложнее выполнить другое требование к каузальному выводу - отсутствие правдоподобных альтернативных объяснений. Под внутренней В. понимается уверенность в том, что именно независимая переменная X служит основной причиной систематической изменчивости значений зависимой переменной Y, т.е. отсутствуют другие переменные, опосредующие связь между X и Y. Мы не в состоянии гарантировать В. эксперимента, но с учетом особенностей используемой исследовательской процедуры можем идентифицировать и устранить основные причины невалидности. Кэмпбелл и Стэнли предложили классификацию причин снижения внутренней В. История (фон) - это события, которые произошли между X и Y и могли повлиять на их ковариацию. Естественные изменения - перемены во внутреннем состоянии испытуемых, не связанные с влиянием X, такие как усталость, взросление, научение. Эффект инструмента связан с нежелательными изменениями измерительных процедур (технические поломки, усталость наблюдателей). Эффект статистической регрессии (соскальзывание к среднему) наблюдается тогда, когда экспериментальные и/или контрольные группы отбирались на основании крайних значений релевантных показателей; по причинам статистического свойства к моменту второго измерения максимальные значения показателей понизятся, а минимальные повысятся. Отбор групп как причина невалидности связан с неслучайным (неэквивалентным) отбором испытуемых или других единиц исследования. Отсев ("экспериментальная смертность ") означает неравномерное и неслучайное выбывание участников исследования. Взаимодействие отбора с другими факторами описывает ситуацию, когда неслучайно отобранные испытуемые имеют разную личную историю, склонность к усталости, отсев и др. Внутренняя В. оценивается качественно по степени отклонения исследовательской процедуры от некоторого идеального случая. Это касается также неэкспериментальных планов исследования, в которых к приведенному перечню причин снижения валидности добавляются новые угрозы. Внешняя В. характеризует степень обобщаемости полученных результатов на иные генеральные совокупности и контексты. Успешное воспроизведение исследования служит одним из важных условий оценки достоверности теорий и помогает уточнить диапазон пригодности последних. Одной из стратегий достижения внешней В. также является идентификация и устранение причин, ответственных за случайное получение результата. Это, в частности, реактивный эффект (влияние процедуры начального измерения на поведение испытуемых) и взаимная интерференция экспериментальных воздействий. Другие стратегии основаны на использовании плана рандомизированного эксперимента с единственным измерением после исследования (что снимает реактивный эффект); снижение риска влияния экспериментатора (напр., минимизация контактов экспериментатора с испытуемым, увеличение количества исследователей или двойной слепой метод, когда исследователь до окончания эксперимента не знает, кто из испытуемых каким воздействиям подвергается); повышение экологической В. (реалистичности) исследования. Важную методологическую роль в обеспечении В. научного исследования играет воспроизведение с расширением, когда каждая последующая репликация эксперимента предусматривает небольшие процедурные модификации. В. статистического вывода Под В. статистического вывода понимается выполнение комплекса условий, уменьшающих вероятность неверного статистического решения о нулевой гипотезе (о равенстве параметра некоторому значению или соответствии статистической модели полученным данным) или величине эффекта. Основным методом принятие статистических решений в последние десятилетия стала проверка статистической значимости, т.е. о равенстве параметра некоторому значению. Для этого используются критерии z, t, F, x2 и др. Эмпирически полученное значение критерия сравнивается с критическим, и на основании этого сравнения нуль-гипотеза отвергается или не отвергается. Т.о., решение носит бинарный характер (да-нет). В этом процессе можно совершить одну из трех ошибок: неверно отвергнуть истинную нуль-гипотезу (ошибка первого рода, альфа), неверно принять истинную альтернативную гипотезу (ошибка второго рода, бета) и неверно сформулировать статистические гипотезы, т.е. неправильно перевести исследовательский вопрос на язык статистики. Угрозы В. статистического вывода многочисленны и имеют разную природу. Использование невалидных индикаторов (раздел данной статьи Валидность измерительных процедур) не дает возможности уверенно интерпретировать полученный результат. Использование ненадежно измеренных переменных приводит к существенному занижению полученных статистик. Большой класс угроз В. статистического вывода связан с неверным формулированием модели. В частности, более известные линейные модели выбираются в тех случаях, когда лежащие в их основе предположения нарушаются: связь между переменными носит нелинейный характер, присутствуют экстремальные значения, дисперсии зависимой переменной для разных уровней независимой переменной неравны, переменные измерены более грубо, чем того требует модель, отсутствующие значения переменных распределены неслучайным образом. В стандартных пакетах статистического анализа имеются методы диагностики нарушений предположений модели. Более сложные концептуальные ошибки совершаются в связи с неверным определением переменных как независимых или ковариирующих, неправильным выбором моделей для зависимых (повторных) или независимых измерений, фиксированных или случайных эффектов. При сравнении нескольких средних или оценке значимости нескольких корреляций исследователи не всегда учитывают инфляцию ошибки первого рода: так, для j переменных мы получаем k = j(j - 1)/2 корреляций, и вероятность случайно получить хотя бы один значимый коэффициент корреляции, альфаобщ., равна 1 - (1 - альфа)k. Использование слишком большого числа переменных при небольшом числе наблюдений (респондентов) создает "сверхпригодность" модели, когда модель идеально описывает выборочные данные, но неадекватна для описания генеральной совокупности. Многие простые ошибки статистического вывода обусловлены причудливым и механическим объединением двух разных подходов к статистическому решению - Фишера и Неймана-Пирсона. Последний подход подчеркивает важность мощности критерия для оценки значимости. Так, результат может оказаться статистически незначимым по причинам, связанным с недостаточной мощностью метода: слабость экспериментального воздействия, маленькая или гетерогенная выборка, ненадежное измерение переменных, чрезмерно малое значение ошибки первого рода. Статистическая значимость - это вероятность того, что полученный результат случаен на выборке данного объема, однако эта величина ничего не говорит о величине эффекта. Современные руководства рекомендуют сообщать в публикациях не только показатель значимости (p), но значения эффекта (типичные показатели - r Пирсона, t Стьюдента, d Коэна, g Хиджеса, ню2 для дисперсионного анализа и др.). Другими альтернативами бинарным решениям о статистической значимости являются доверительные интервалы, байесовы статистики и, в более широком смысле, воспроизведение с расширением и метаанализ. В. в качественных исследованиях В. в качественных исследованиях не может быть оценена с помощью описанных выше классических методов. Ряд авторов показывают примитивность имеющихся подходов к оценке В. и "критериологии" в целом (Т.Швандт, Дж.Смит). В то же время отказ от идеи достоверности/аутентичности в отличие от дискредитированной объективности выглядит слишком радикальным даже для постмодернистских исследователей. Поэтому другие авторы (Э.Губа, И.Линкольн, С.Квале, С.Мишлер) пытаются переформулировать традиционные критерии валидности, сделав их менее позитивистскими. Обсуждаются новые процедуры обоснования достоверности: коммуникативная валидизация (участие испытуемых в обсуждении результатов; привлечение к обсуждению коллег), процедурная валидизация (точность, тщательность и полнота полевых заметок или получаемых данных; полное, сбалансированное и прозрачное описание результатов, открытое для иных интерпретаций; чувствительность к обратной связи со стороны коллег; перепроверка выводов на других фрагментах полученного материала) и т.д. Среди прочих подходов к обоснованию достоверности результатов следует упомянуть установление степени правдоподобия (plausibility) как оценки полученного знания с позиции уже имеющихся знаний; доверие (credibility) как оценка и коллективного осмысления результатов с учетом природы феномена, и обстоятельств его наблюдения; укорененность в данных, включенность в контекст исследовательской программы (dependability), которая основана на тщательном изучении и оценке процедурных аспектов; чувствительность как способность исследователя увидеть социальную проблему и способствовать ее решению; онтологическая и образовательная аутентичность - способность повысить сознательность участников исследования (в первом случае) и их окружения (во втором); каталитическая аутентичность как влияние на социальные программы, способствующие улучшению качества жизни изучаемой популяции. Постмодернистскими авторами обсуждаются принципиально новые понятия и принципы обоснования знания: ироническая (Ж.Бодрийар), неопрагматическая (Ж.-Ф.Лиотар), ризоматическая (Ж.Деррида) валидизация. Н.Дензин обосновал метод триангуляции как радикальной альтернативы традиционным подходам к валидизации. Триангуляция есть сочетанное и взаимообогащающее использование разных методов, методологий, данных, теорий и/или исследователей. Множественность подходов и приемов призвана ослабить эпистемологические ограничения, перейти установленные границы, выявить новые стороны феномена. Следует отметить, что идея триангуляции [истины] была порождена в постпозитивизме (Д.Кэмпбелл), где она понималась как некоторая процедура, набор полезных трюков: в дополнение к опросу "обычных" людей опросить экспертов; случайным образом расщепить выборку испытуемых пополам и провести анализ данных раздельно; исключить из анализа одну переменную и посмотреть, как изменится модель; валидизировать конструкт с помощью подхода "много черт - много методов" и т.д. Чтобы избежать нежелательных ассоциаций с позитивизмом, постмодернистская исследовательница-этнограф Л.Ричардсон в радикальном духе отказывается от идеи триангуляции и предлагает иную привлекательную метафору - кристалла, а не треугольника, кристаллизации, а не триангуляции. Кристалл одновременно создает, преломляет и искажает, он многогранен, и ни одна из его граней не более достоверна, чем любая другая. Как и знание, кристалл растет и разрушается. Метафорический подход к проблеме обоснования знания и оценки его качества неслучаен. Он призван разрушить критериальные подходы и представления о стандартах. Социальное исследование обладает ценностью лишь тогда, когда дает равные возможности высказаться представителям разных групп, создает равновероятные версии и подавляет доминирующие, "правильные" интерпретации. С.В. Сивуха

10) Валидность - (validity) - степень, в которой измерение, показатель или метод сбора данных обладает свойством быть настолько правильным или истинным, насколько это можно оценить. Например, если такое психологическое измерение, как тест интеллекта, считается валидным, то это означает, что оно уместно для измерения того, что предполагается измерить. Когда говорят, что социальные обзоры принесли валидные данные, то считается, что они являются истинным отражением изучаемого явления (например, проектирования электорального поведения исследуемого населения). То есть метод обзора обладает валидностью. Ср. Достоверность. На практике в социологии и социальных науках в целом отношение между показателями и мерами, с одной стороны, и лежащими в их основе принятыми концепциями - с другой, часто оспаривается (см. Официальная статистика; Измерение по декрету) .

Валидность

(от лат. validus - сильный, крепкий) - англ. validity; нем. Validitat/Gulltigkeit. Обоснованность и адекватность исследовательских инструментов (операционализированных понятий, измерительных операций и экспериментов).

(от лат. validus - сильный, крепкий) - обоснованность и адекватность исследовательских инструментов (операционализированных понятий, измерительных операций и экспериментов). В. логическая (В. внутренняя) - степень взаимосвязи и взаимной выводимости переменных и индикаторов. В. эмпирическая (В. внешняя) - степень соответствия переменных и индикаторов эмпирическим данным.

обоснованность и адекватность цели инструментов и методов исследования, понятий и экспериментов.

Основной показатель качества измерения в социологическом исследовании, отражающий степень соответствия данных измерения объекту измерения.

Соответствие цели и средств социологического измерения; полностью валидны только бесцельные измерения.

Мера пригодности применяемых в прикладной социологии методики для решения определенных исследовательских задач, степень соответствия переменных и индикаторов эмпирическим данным, позволяющая получать надежные, репрезентативные и достоверные результаты социологического исследования, избегать систематических ошибок.

– основная характеристика качества измерения в социологии, одна из составляющих надежности социологической информации. Различают теоретическую (концептуальную) и эмпирическую (валидность по критерию).

(достоверность) свидетельствует о степени правильности, истинности представленных данных, призванных подтвердить гипотезу.

1. Показатель качества метода, его способность давать результаты, адекватно отражающие изучаемое явление, т.е. именно те результаты, для получения которых он предназначен (В. метода). 2. Мера соответствия теории эмпирическим данным, возможность делать разумно точные предсказания на основании теории (В. теории). 3. Мера соответствия результатов изучаемой реальности, точнее, представлениям о реальности (В. результатов). В данной статье В. обсуждается в первом смысле. В позитивистской науке различают В. измерения, внутреннюю и внешнюю В. экспериментальных процедур и В. статистического вывода. В. измерительных процедур Под измерением понимают процесс связывания теоретического понятия с одной или несколькими латентными переменными, а этих последних - с наблюдаемыми переменными. В классической теории результат измерения включает два не коррелирующих компонента: истинный и ошибочный. В отношении ошибок измерения делаются предположения, при выполнении которых поведение ошибок становится известным. В. измерительной процедуры - мера ее соответствия измеряемому конструкту. Чаще других оценивают критериальную (часто называемую эмпирической), конструктную, конвергентную и дискриминантную В. В качестве вспомогательных методов установления В. используют реферирование литературы по вопросу, экспертные оценки. Критериальная В. измерительной процедуры оценивается по тесноте статистической связи (корреляции) между измеренными результатами и внешним критерием. Так, критериальная В. шкалы лидерства означает, что полученный показатель коррелирует с некоторым независимо полученным показателем, например, социометрическими данными. Указание на критериальную В. предполагает не только сообщение о коэффициенте корреляции между показателями теста и внешним показателем, но также о всех обстоятельствах исследования: как и в какой ситуации был измерен критерий, на какой выборке проводилось исследование и др. Критерии могут быть текущими (измеряемыми одновременно с применением валидизируемой процедуры) и прогностическими. Прогностическая В. высоко желательна для практически ориентированных методов измерения. Недостатками подхода является трудности с подбором критерия и риск измерения невалидного критерия, что существенно снижает полученный коэффициент корреляции. Как оцениваемое поведение, так и критерий могут меняться во времени, а выборки могут быть смещенными. Если бы исследователю удалось найти совершенный критерий, создание измерительной процедуры стало бы избыточным. В этой связи понятен парадокс, сформулированный Дж.Келли: В. метода - это его способность предоставлять и без того известную информацию. Зависимость критериальной В. от свойств критерия, невозможность нахождения удовлетворительного объективного показателя во многих областях знания существенно снижают ценность критериальной В. как показателя качества измерительной процедуры. Конструктная В. устанавливается по статистической связи между показателями данной процедуры и других методик, измеряющих родственный конструкт. Гипотезы о статистической связи формулируются до их проверки, на основании содержательной теории. Конструктная валидизация - длительный процесс, и ни одна эмпирическая корреляция не может гарантировать достоверности измерения. Теоретически постулируется связь между конструктами, оценивается корреляция между индикаторами этих конструктов, на основании полученных данных пересматриваются теоретически ожидаемые связи между конструктами или между конструктами и индикаторами. Подбирается новый конструкт (или новый индикатор, или новая теория о связи между конструктами), и процесс повторяется снова. Оба конструкта могут оказаться неродственными. Так бывает, когда измерительные методы, выступающие под одним и тем же названием, строятся на разных теоретических основаниях. Другие проблемы связаны с ситуациями, когда измеренный показатель, привлекаемый для валидизации процедуры, измеряется недостаточно валидно; один и тот же индикатор одновременно измеряет разные конструкты; ошибки измерения коррелируют между собой. Если исследователь уверен/а в том, что структурная схема корректна (отсутствуют связи между индикаторами и посторонними конструктами, а корреляция между ошибками измерения равна нулю), он/а может найти корреляцию между конструктами, скорректированную на ненадежность индикаторов. Для оценки конструктной В. измерительной процедуры часто используют факторный анализ индикаторов. Под этим именем понимается широкий набор методов снижения размерности данных, когда из множества измеренных переменных извлекается небольшое количество латентных переменных (факторов). Количество и теоретическая интерпретируемость факторов трактуется как мера В. измерительного метода, а факторные нагрузки измеренных переменных - как мера В. индикаторов. Факторная нагрузка - это стандартизованная мера структурной связи между общим фактором (латентной переменной) и индикатором. Ее часто определяют как корреляцию между фактором и переменной. Широко известные методы факторного анализа (например, анализ главных осей) является эксплораторной процедурой, т.е. не позволяет проверять статистических гипотез, а результат анализа существенно определяется техническими решениями, который принимает исследователь. В этом смысле возможности метода как средства валидизации ограничены. Чтобы ослабить произвол при проведении факторного анализа, используют кросс-валидизацию: выборка случайно расщепляется пополам, факторы извлекаются на одной половине выборки, а оправданность и устойчивость факторного решения проверяется на другой половине. Понятия конвергентной и дискриминантной В. введены Д. Кембеллом и Д. Фиске как два взаимосвязанных показателя достоверности метода. Конвергентная В. требует "сходимости" (высокой корреляции) родственных конструктов, дискриминантная В. - отсутствия корреляций между измерениями неродственных конструктов. Более строго эта концепция реализована в подходе, известном под именем "Много черт - много методов", или МЧММ (MTMM - many traits, many methods). Суть его в том, что несколько свойств измеряются несколькими методами. Между показателями одного и того же свойства, измеренного с помощью разных методов, должны быть высокие корреляции, между показателями разных свойств, измеренными с помощью одного метода, - низкие. Третьим условием является превышение первого набора коэффициентов корреляции над вторым. Есть и более строгие статистические методы анализа корреляционной матрицы МЧММ. В последние годы приобрели популярность структурные уравнения, в частности, конфирматорный факторный анализ, который в соответствии с содержательной моделью раскладывает ковариации измерений на компоненты, связанные с влиянием методов, свойств, и ошибки. Полученные структурные коэффициенты интерпретируются как показатели В. В. экспериментального метода Круг понятий, связанных с оценкой В. эксперимента (и результатов эксперимента), был разработан методологами-постпозитивистами в 1960-х (Д. Кэмпбелл, Т. Кук, Дж. Стэнли и др.). В эпистемологической традиции, восходящей к Дж.С.Миллю и связывающей причинность с манипуляцией, истинный эксперимент со случайным распределением испытуемых по условиям рассматривается как единственное средство убедительной проверки каузальных гипотез. С этой точки зрения причинные утверждения в неэкспериментальных науках (социологии) нелегитимны. Предшествование во времени предполагаемой причины (независимой переменной) следствию (зависимой переменной) как одно из условий каузальной связи в эксперименте обеспечивается манипуляцией и измерением ее последствий. Сложнее выполнить другое требование к каузальному выводу - отсутствие правдоподобных альтернативных объяснений. Под внутренней В. понимается уверенность в том, что именно независимая переменная X служит основной причиной систематической изменчивости значений зависимой переменной Y, т.е. отсутствуют другие переменные, опосредующие связь между X и Y. Мы не в состоянии гарантировать В. эксперимента, но с учетом особенностей используемой исследовательской процедуры можем идентифицировать и устранить основные причины невалидности. Кэмпбелл и Стэнли предложили классификацию причин снижения внутренней В. История (фон) - это события, которые произошли между X и Y и могли повлиять на их ковариацию. Естественные изменения - перемены во внутреннем состоянии испытуемых, не связанные с влиянием X, такие как усталость, взросление, научение. Эффект инструмента связан с нежелательными изменениями измерительных процедур (технические поломки, усталость наблюдателей). Эффект статистической регрессии (соскальзывание к среднему) наблюдается тогда, когда экспериментальные и/или контрольные группы отбирались на основании крайних значений релевантных показателей; по причинам статистического свойства к моменту второго измерения максимальные значения показателей понизятся, а минимальные повысятся. Отбор групп как причина невалидности связан с неслучайным (неэквивалентным) отбором испытуемых или других единиц исследования. Отсев ("экспериментальная смертность ") означает неравномерное и неслучайное выбывание участников исследования. Взаимодействие отбора с другими факторами описывает ситуацию, когда неслучайно отобранные испытуемые имеют разную личную историю, склонность к усталости, отсев и др. Внутренняя В. оценивается качественно по степени отклонения исследовательской процедуры от некоторого идеального случая. Это касается также неэкспериментальных планов исследования, в которых к приведенному перечню причин снижения валидности добавляются новые угрозы. Внешняя В. характеризует степень обобщаемости полученных результатов на иные генеральные совокупности и контексты. Успешное воспроизведение исследования служит одним из важных условий оценки достоверности теорий и помогает уточнить диапазон пригодности последних. Одной из стратегий достижения внешней В. также является идентификация и устранение причин, ответственных за случайное получение результата. Это, в частности, реактивный эффект (влияние процедуры начального измерения на поведение испытуемых) и взаимная интерференция экспериментальных воздействий. Другие стратегии основаны на использовании плана рандомизированного эксперимента с единственным измерением после исследования (что снимает реактивный эффект); снижение риска влияния экспериментатора (напр., минимизация контактов экспериментатора с испытуемым, увеличение количества исследователей или двойной слепой метод, когда исследователь до окончания эксперимента не знает, кто из испытуемых каким воздействиям подвергается); повышение экологической В. (реалистичности) исследования. Важную методологическую роль в обеспечении В. научного исследования играет воспроизведение с расширением, когда каждая последующая репликация эксперимента предусматривает небольшие процедурные модификации. В. статистического вывода Под В. статистического вывода понимается выполнение комплекса условий, уменьшающих вероятность неверного статистического решения о нулевой гипотезе (о равенстве параметра некоторому значению или соответствии статистической модели полученным данным) или величине эффекта. Основным методом принятие статистических решений в последние десятилетия стала проверка статистической значимости, т.е. о равенстве параметра некоторому значению. Для этого используются критерии z, t, F, x2 и др. Эмпирически полученное значение критерия сравнивается с критическим, и на основании этого сравнения нуль-гипотеза отвергается или не отвергается. Т.о., решение носит бинарный характер (да-нет). В этом процессе можно совершить одну из трех ошибок: неверно отвергнуть истинную нуль-гипотезу (ошибка первого рода, альфа), неверно принять истинную альтернативную гипотезу (ошибка второго рода, бета) и неверно сформулировать статистические гипотезы, т.е. неправильно перевести исследовательский вопрос на язык статистики. Угрозы В. статистического вывода многочисленны и имеют разную природу. Использование невалидных индикаторов (раздел данной статьи Валидность измерительных процедур) не дает возможности уверенно интерпретировать полученный результат. Использование ненадежно измеренных переменных приводит к существенному занижению полученных статистик. Большой класс угроз В. статистического вывода связан с неверным формулированием модели. В частности, более известные линейные модели выбираются в тех случаях, когда лежащие в их основе предположения нарушаются: связь между переменными носит нелинейный характер, присутствуют экстремальные значения, дисперсии зависимой переменной для разных уровней независимой переменной неравны, переменные измерены более грубо, чем того требует модель, отсутствующие значения переменных распределены неслучайным образом. В стандартных пакетах статистического анализа имеются методы диагностики нарушений предположений модели. Более сложные концептуальные ошибки совершаются в связи с неверным определением переменных как независимых или ковариирующих, неправильным выбором моделей для зависимых (повторных) или независимых измерений, фиксированных или случайных эффектов. При сравнении нескольких средних или оценке значимости нескольких корреляций исследователи не всегда учитывают инфляцию ошибки первого рода: так, для j переменных мы получаем k = j(j - 1)/2 корреляций, и вероятность случайно получить хотя бы один значимый коэффициент корреляции, альфаобщ., равна 1 - (1 - альфа)k. Использование слишком большого числа переменных при небольшом числе наблюдений (респондентов) создает "сверхпригодность" модели, когда модель идеально описывает выборочные данные, но неадекватна для описания генеральной совокупности. Многие простые ошибки статистического вывода обусловлены причудливым и механическим объединением двух разных подходов к статистическому решению - Фишера и Неймана-Пирсона. Последний подход подчеркивает важность мощности критерия для оценки значимости. Так, результат может оказаться статистически незначимым по причинам, связанным с недостаточной мощностью метода: слабость экспериментального воздействия, маленькая или гетерогенная выборка, ненадежное измерение переменных, чрезмерно малое значение ошибки первого рода. Статистическая значимость - это вероятность того, что полученный результат случаен на выборке данного объема, однако эта величина ничего не говорит о величине эффекта. Современные руководства рекомендуют сообщать в публикациях не только показатель значимости (p), но значения эффекта (типичные показатели - r Пирсона, t Стьюдента, d Коэна, g Хиджеса, ню2 для дисперсионного анализа и др.). Другими альтернативами бинарным решениям о статистической значимости являются доверительные интервалы, байесовы статистики и, в более широком смысле, воспроизведение с расширением и метаанализ. В. в качественных исследованиях В. в качественных исследованиях не может быть оценена с помощью описанных выше классических методов. Ряд авторов показывают примитивность имеющихся подходов к оценке В. и "критериологии" в целом (Т.Швандт, Дж.Смит). В то же время отказ от идеи достоверности/аутентичности в отличие от дискредитированной объективности выглядит слишком радикальным даже для постмодернистских исследователей. Поэтому другие авторы (Э.Губа, И.Линкольн, С.Квале, С.Мишлер) пытаются переформулировать традиционные критерии валидности, сделав их менее позитивистскими. Обсуждаются новые процедуры обоснования достоверности: коммуникативная валидизация (участие испытуемых в обсуждении результатов; привлечение к обсуждению коллег), процедурная валидизация (точность, тщательность и полнота полевых заметок или получаемых данных; полное, сбалансированное и прозрачное описание результатов, открытое для иных интерпретаций; чувствительность к обратной связи со стороны коллег; перепроверка выводов на других фрагментах полученного материала) и т.д. Среди прочих подходов к обоснованию достоверности результатов следует упомянуть установление степени правдоподобия (plausibility) как оценки полученного знания с позиции уже имеющихся знаний; доверие (credibility) как оценка и коллективного осмысления результатов с учетом природы феномена, и обстоятельств его наблюдения; укорененность в данных, включенность в контекст исследовательской программы (dependability), которая основана на тщательном изучении и оценке процедурных аспектов; чувствительность как способность исследователя увидеть социальную проблему и способствовать ее решению; онтологическая и образовательная аутентичность - способность повысить сознательность участников исследования (в первом случае) и их окружения (во втором); каталитическая аутентичность как влияние на социальные программы, способствующие улучшению качества жизни изучаемой популяции. Постмодернистскими авторами обсуждаются принципиально новые понятия и принципы обоснования знания: ироническая (Ж.Бодрийар), неопрагматическая (Ж.-Ф.Лиотар), ризоматическая (Ж.Деррида) валидизация. Н.Дензин обосновал метод триангуляции как радикальной альтернативы традиционным подходам к валидизации. Триангуляция есть сочетанное и взаимообогащающее использование разных методов, методологий, данных, теорий и/или исследователей. Множественность подходов и приемов призвана ослабить эпистемологические ограничения, перейти установленные границы, выявить новые стороны феномена. Следует отметить, что идея триангуляции [истины] была порождена в постпозитивизме (Д.Кэмпбелл), где она понималась как некоторая процедура, набор полезных трюков: в дополнение к опросу "обычных" людей опросить экспертов; случайным образом расщепить выборку испытуемых пополам и провести анализ данных раздельно; исключить из анализа одну переменную и посмотреть, как изменится модель; валидизировать конструкт с помощью подхода "много черт - много методов" и т.д. Чтобы избежать нежелательных ассоциаций с позитивизмом, постмодернистская исследовательница-этнограф Л.Ричардсон в радикальном духе отказывается от идеи триангуляции и предлагает иную привлекательную метафору - кристалла, а не треугольника, кристаллизации, а не триангуляции. Кристалл одновременно создает, преломляет и искажает, он многогранен, и ни одна из его граней не более достоверна, чем любая другая. Как и знание, кристалл растет и разрушается. Метафорический подход к проблеме обоснования знания и оценки его качества неслучаен. Он призван разрушить критериальные подходы и представления о стандартах. Социальное исследование обладает ценностью лишь тогда, когда дает равные возможности высказаться представителям разных групп, создает равновероятные версии и подавляет доминирующие, "правильные" интерпретации. С.В. Сивуха

После надежности ключевым критерием оценки качества методик является валидность. Вопрос о валидности методики решается лишь после того, как установлена достаточная ее надежность, поскольку ненадежная методика не может быть валидной. Но самая надежная методика без знания ее валидности является практически бесполезной.

Следует заметить, что вопрос о валидности до последнего времени представляется одним из самых сложных. Наиболее укоренившимся определением этого понятия является то, которое приведено в книге А. Анастази: "Валидность теста - понятие, указывающее нам, что тест измеряет и насколько хорошо он это делает" .

Валидность по своей сути - это комплексная характеристика, включающая, с одной стороны, сведения о том, пригодна ли методика для измерения того, для чего она была создана, а с другой - какова ее действенность, эффективность, практическая полезность.

Не существует какого-то единого универсального подхода к определению валидности. В зависимости от того, какую сторону валидности хочет рассмотреть исследователь, используются и разные способы доказательства. Иными словами, понятие валидности включает в себя разные ее виды, имеющие свой особый смысл. Проверка валидности методики называется валидизацией.

Валидность в первом ее понимании (пригодна ли методика для измерения того, для чего она была создана) имеет отношение к сущности самой методики, т.е. это внутренняя валидность измерительного инструмента. Такая проверка называется теоретической валидизацией.

Валидность во втором понимании (какова действенность, эффективность, практическая полезность методики) относится не столько к методике, сколько к цели ее использования. Это прагматическая валидизация.

Обобщая, можно сказать следующее:

- при теоретической валидизации исследователя интересует само свойство (конструкт), измеряемое методикой. Это, по существу, означает, что проводится собственно психологическая валидизация
- при прагматической валидизации суть предмета измерения (психологического свойства) оказывается вне поля зрения. Главный акцент сделан на то, чтобы доказать, что "нечто", измеряемое методикой, имеет связь с определенными областями практики.

Теоретическая валидизация методики осуществляется путем доказательства ее конструктной валидности. Конструктная валидность, обоснованная Л. Кронбахом в 1955 г., характеризуется способностью методики к измерению такой черты, которая была обоснована теоретически (как теоретический конструкт). Когда сложно найти адекватный прагматический критерий, может быть выбрана ориентация на гипотезы, сформулированные на основе теоретических предположений об измеряемом свойстве. Подтверждение этих гипотез свидетельствует о теоретической обоснованности методики. Сначала необходимо насколько возможно полно, содержательно описать конструкт, для измерения которого она предназначена. Достигается это за счет формулирования гипотез о нем, предписывающих, с чем данный конструкт должен коррелировать, а с чем не должен. После этого данные гипотезы проверяются. Такой способ наиболее эффективен для валидизации личностных опросников, поскольку установление единственного критерия их обоснованности является затруднительным.

В качестве конструкта могут выступать интеллект, черты личности, мотивы, установки и т.д. Обращение к конструктной валидности необходимо в тех случаях, когда результаты диагностических измерений используются не просто для предсказания поведения, а для выводов о том, в какой степени испытуемые обладают определенной психологической характеристикой. При этом измеряемая психологическая характеристика не может быть отождествлена с какой-либо наблюдаемой особенностью поведения, а представляет собой теоретическую концепцию. Конструктная валидность имеет значение при разработке принципиально новых методик, для которых не определены внешние критерии валидности.

Таким образом, провести теоретическую валидизацию методики - это доказать ее конструктную валидность, т.е. установить, что методика измеряет именно тот конструкт (свойство, качество), который она по замыслу исследователя должна измерять. Так, если какой-то тест разрабатывался для того, чтобы диагностировать умственное развитие детей, надо проанализировать, действительно ли он измеряет именно это развитие, а не какие-то другие особенности (например, личность, характер и т.п.). Следовательно, для теоретической валидизации кардинальной проблемой является отношение между психологическими явлениями и их показателями, посредством которых эти психологические явления пытаются познать. Такая проверка показывает, насколько замысел автора и результаты методики совпадают.

Чаще всего конструктная валидность методики определяется через ее внутреннюю согласованность, а также через конвергентную и дискриминантную валидность. Еще одним способом определения конструктной валидности является факторный анализ.

Внутренняя согласованность отражает то, насколько задания, вопросы, составляющие материал методики, подчинены основному направлению измеряемого как целого, ориентированы на изучение одного и того же явления. Анализ внутренней согласованности осуществляется путем коррелирования ответов на каждое задание с общим результатом методики. Так, если тест состоит из заданий, показавших значимую корреляцию с его общим баллом, то говорят, что тест обладает внутренней согласованностью, поскольку все его задания подчинены конструкту, представленному в тесте.

Критерием внутренней согласованности является также корреляция между суммарным баллом методики и результатами выполнения отдельных ее частей. Тесты, где в качестве конструкта выступает интеллект, всегда состоят из раздельно применяемых субтестов (таких, например, как осведомленность, аналогии, классификации, умозаключения и т.д.), из результатов которых складывается общий балл теста. Значимые корреляции между результатами каждого субтеста и общим баллом также свидетельствуют о внутренней согласованности всего теста.

Кроме того, для доказательства внутренней согласованности используются контрастные группы, которые формируются из испытуемых, показавших самые высокие и самые низкие суммарные результаты. Выполнение методики группой с высокими результатами сравнивается с выполнением группой с низкими результатами, и если первая группа справляется с заданиями лучше, чем вторая, методика признается внутренне согласованной.

Как подчеркивает А. Анастази, критерий внутренней согласованности методики - это существенная мера ее однородности. Так как этот показатель помогает охарактеризовать область поведения или свойство, выборочно проверяемое методикой, то степень ее однородности имеет отношение к конструктной валидности. Конечно, сама по себе внутренняя согласованность методики мало что может сказать о том, что она измеряет. Однако при наличии тщательно проработанных теоретических оснований создания методики, прочно обоснованной научной базы эта процедура подкрепляет теоретические представления о ее психологической сущности.

Другой способ определения конструктной валидности предполагает оценку методики по двум показателям, противоположным друг другу. Важно сопоставить показатели валидизируемой методики, с одной стороны, с методиками, имеющими тот же теоретический конструкт, и, с другой - с методиками, имеющими другое теоретическое основание. Для этого используется предложенная Д. Т. Кэмпбеллом и Д. В. Фиске процедура оценки конвергентной и дискриминантной валидности.

Конвергентная валидность (от лат. - сходиться к одному центру, конвертировать) - это заключение о подобии (изоморфизм - гомоморфизм) данного метода (методики, теста, меры) другому методу, предназначенному для тех же целей (конвергентному, сходному). Она выражается в требовании статистической зависимости диагностических показателей, если они направлены на измерение концептуально родственных психических свойств индивида.

Дискриминантная валидность (от лат. - разница, различие) - заключение об отличии одного метода (методики, теста, меры) от другого, теоретически отличающегося от первого. Она выражается в отсутствии статистической зависимости между диагностическими показателями, отражающими концептуально независимые свойства.

Конвергентная и дискриминантная валидности - это виды критериальной валидности. В эту категорию входят любые типы валидности, оцениваемые с использованием независимого признака, являющегося критерием оценки, сравнения .

Итак, процедура оценки конвергентной и дискриминантной валидности состоит в установлении одновременно как сходства, так и различия психологических феноменов, измеряемых новой методикой, с уже известными методиками. Она предполагает использование наряду с валидизируемой методикой специальной батареи контрольных методик, подобранной таким образом, чтобы в нее входили как методики, предположительно связанные с валидизируемой, так и не связанные с пей. Экспериментатор должен заранее предсказать, какие методики будут высоко коррелировать с валидизируемой, а корреляции с какими методиками будут низкими. В соответствии с этим различают конвергентную валидность (проверка степени близости прямой или обратной связи) и дискриминантную валидность (установление отсутствия связи). Методики, которые, но предположению, высоко коррелируют с валидизируемой, называются конвергирующими, а не коррелирующие - дискриминантными.

Подтверждение совокупности теоретически ожидаемых связей составляет важный круг сведений конструктной валидности. В англоязычной психодиагностике такое операциональное определение конструктной валидности обозначается как предполагаемая валидность (assumed validity).

Наличие корреляции между новой и аналогичной по конструкту методике, валидность которой ранее доказана, указывает на то, что разрабатываемая методика "измеряет" примерно то же психологическое качество, что и эталонная методика. И если новый метод одновременно оказывается более компактным и экономичным в проведении и обработке результатов, то психодиагносты получают возможность использовать новый инструмент вместо старого. Такой прием особенно часто используется в дифференциальной психофизиологии при создании методик диагностики основных свойств нервной системы человека. Особое место в процедуре определения конструктной валидности занимает факторный анализ (факторная валидность). Он позволяет строго статистически проанализировать структуру связей показателей исследуемой методики, определить их факторный состав и факторные нагрузки, выявить скрытые признаки и внутренние закономерности их взаимосвязи.

Итак, при теоретической валидизации методики требуется применение разнообразных экспериментальных процедур, способствующих накоплению информации о диагностируемом конструкте. Если эти данные подтверждают гипотезу, то тем самым подтверждается психологическая концепция, положенная в основу методики, и способность методики служить инструментом измерения этой концепции. Чем убедительнее подтверждение, тем определеннее можно говорить о валидности методики по отношению к психологической концепции, положенной в ее основу.

Важную роль для понимания того, что методика измеряет, играет сопоставление ее показателей с практическими формами деятельности. Но здесь особенно важно, чтобы методика была тщательно проработана в теоретическом плане, т.е. чтобы имелась прочная, обоснованная научная база. Тогда при сопоставлении методики с взятым из повседневной практики внешним критерием, соответствующим тому, что она измеряет, может быть получена информация, подкрепляющая теоретические представления о ее сущности.

Важно помнить, что если доказана теоретическая валидность, то интерпретация полученных показателей становится более ясной и однозначной, а название методики соответствует сфере ее применения.

Что касается прагматической валидизации, то она подразумевает проверку методики с точки зрения ее практической эффективности, значимости, полезности, поскольку диагностической методикой имеет смысл пользоваться только тогда, когда доказано, что измеряемое свойство проявляется в определенных жизненных ситуациях, в определенных видах деятельности. Ей придают большое значение особенно там, где встает вопрос отбора.

Если обратиться к истории развития тестологии , то можно выделить такой период (1920-1930-е гг.), когда научное содержание тестов и их теоретический "багаж" интересовали в меньшей степени. Важно было, чтобы тест работал, помогал быстро отбирать наиболее подготовленных людей. Эмпирический критерий оценки тестовых заданий считался единственно верным ориентиром в решении научных и прикладных задач.

Использование диагностических методик с чисто эмпирическим обоснованием, без отчетливой теоретической базы нередко приводило к псевдонаучным выводам, к неоправданным практическим рекомендациям. Нельзя было точно назвать те особенности, качества, которые выявляли, например, тесты. Б. М. Теплов, анализируя тесты того периода, назвал их "слепыми пробами" .

Такой подход к проблеме валидности методик был характерен вплоть до начала 1950-х гг. не только для США, но и для других стран. Теоретическая слабость эмпирических методов валидизации не могла не вызвать критики со стороны тех ученых, которые в разработке методик призывали опираться не только на "голую" эмпирику и практику, но и на теоретическую концепцию. Практика без теории, как известно, слепа, а теория без практики мертва. В настоящее время теоретико-прагматическая оценка валидности методик воспринимается как наиболее продуктивная.

Для проведения прагматической валидизации методики, т.е. для оценки ее эффективности, действенности, практической значимости, обычно используется независимый внешний критерий - показатель, обладающий непосредственной ценностью для определенной области практики. Таким критерием может быть и успеваемость (для тестов способностей к обучению, тестов достижений, тестов интеллекта), и производственные достижения (для методик профессиональной направленности), и эффективность реальной деятельности - рисование, моделирование и т.д. (для тестов специальных способностей), и субъективные оценки (для тестов личности).

Американские исследователи Д. Тиффин и Е. Маккормик, проведя анализ используемых для доказательства валидности внешних критериев, выделяют четыре их типа :

1) критерии исполнения (в их число могут входить такие, как количество выполненной работы, успеваемость, время, затраченное на обучение, темп роста квалификации и т.п.);
2) субъективные критерии (они включают различные виды ответов, которые отражают отношение человека к чему-либо или к кому-либо, его мнение, взгляды, предпочтения; обычно субъективные критерии получают с помощью интервью, опросников, анкет);
3) физиологические критерии (они используются при изучении влияния окружающей среды и других ситуационных переменных на организм и психику человека; замеряется частота пульса, давление крови, электросопротивление кожи, симптомы утомления и т.д.);
4) критерии случайностей (применяются, когда цель исследования касается, например, проблемы отбора для работы таких лиц, которые менее подвержены несчастным случаям).

Внешний критерий должен отвечать трем основным требованиям: он должен быть релевантным, свободным от помех (контаминации) и надежным.

Под релевантностью имеется в виду смысловое соответствие диагностического инструмента независимому жизненно важному критерию. Другими словами, должна быть уверенность в том, что в критерии задействованы именно те особенности индивидуальной психики, которые измеряются и диагностической методикой. Внешний критерий и диагностическая методика должны находиться между собой во внутреннем смысловом соответствии, быть качественно однородными по психологической сущности. Если, например, тест измеряет индивидуальные особенности мышления, умение выполнять логические действия с определенными объектами, понятиями, то и в критерии нужно искать проявление именно этих умений. Это в равной степени относится и к профессиональной деятельности. Она имеет не одну, а несколько целей, задач, каждая из которых специфична и предъявляет свои условия к выполнению. Из этого вытекает существование нескольких критериев выполнения профессиональной деятельности. Поэтому не следует проводить сопоставление успешности по диагностическим методикам с производственной эффективностью в целом. Необходимо найти такой критерий, который по характеру выполняемых операций соотносим с методикой.

Если относительно внешнего критерия неизвестно, релевантен он измеряемому свойству или нет, то сопоставление с ним результатов психодиагностической методики становится практически бесполезным. Оно не позволяет прийти к каким-либо выводам, которые могли бы дать оценку валидности методики.

Требования свободы от помех (контаминации) вызываются тем, что, например, учебная или производственная успешность зависит от двух переменных: от самого человека, его индивидуальных особенностей, измеряемых методиками, и от ситуации, условий учебы, труда, которые могут привнести помехи, "загрязнить" применяемый критерий. Чтобы в какой-то мере избежать этого, следует отбирать для исследования такие группы людей, которые находятся в более или менее одинаковых условиях. Можно использовать и другой метод. Он состоит в корректировке влияния помех. Эта корректировка носит обычно статистический характер. Так, производительность следует брать нс по абсолютным значениям, а в отношении к средней производительности рабочих, работающих в аналогичных условиях.

Когда говорят, что критерий должен иметь статистически достоверную надежность, это означает, что он должен отражать постоянство и устойчивость исследуемой функции.

Поиски адекватного и легко выявляемого критерия относятся к очень важным и сложным задачам валидизации. В западной тестологии много методик дисквалифицировано только потому, что не удалось найти подходящего критерия для их проверки. Например, у большей части анкет данные по их валидности сомнительны, так как трудно найти адекватный внешний критерий, отвечающий тому, что они измеряют.

Оценка прагматической валидности методик может носить количественный и качественный характер.

Для вычисления количественного показателя - коэффициента валидности - сопоставляются результаты, полученные при применении диагностической методики, с данными, полученными по внешнему критерию, тех же лиц. Используются разные виды линейной корреляции (по Спирмену, по Пирсону).

Сколько испытуемых необходимо для расчета валидности? Практика показала, что их не должно быть меньше 50, однако лучше всего более 200. Часто возникает вопрос, какой должна быть величина коэффициента валидности, чтобы она считалась приемлемой? В целом отмечается, что достаточно того, чтобы коэффициент валидности был статистически значим. Низким признается коэффициент валидности порядка 0,20 0,30, средним - 0,30- 0,50 и высоким - свыше 0,60.

Но, как подчеркивают А. Анастази и К. М. Гуревич и другие авторы, не всегда для вычисления коэффициента валидности правомерно использовать линейную корреляцию. Этот прием оправдан лишь тогда, когда доказано, что успех в какой-то деятельности прямо пропорционален успеху в выполнении диагностической методики. Позиция зарубежных тестологов, особенно тех, кто занимается профпригодностью и профотбором, чаще всего сводится к безоговорочному признанию того, что для профессии больше подойдет тот, кто больше выполнил заданий в тесте. Но может быть и так, что для успеха в деятельности нужно обладать свойством на уровне 40% решения теста. Дальнейший успех в тесте уже не имеет никакого значения для профессии. Наглядный пример из монографии К. М. Гуревича: почтальон должен уметь читать, но читает ли он с обычной скоростью или с очень большой скоростью - это уже не имеет профессионального значения. При таком соотношении показателей методики и внешнего критерия наиболее адекватным способом установления валидности может быть критерий различий.

Как показал опыт работы зарубежных тестологов, ни одна статистическая процедура не в состоянии полностью отразить многообразие индивидуальных оценок. Поэтому часто для доказательства валидности методик используют другую модель - клинические оценки. Это не что иное, как качественное описание сущности изучаемого свойства. В этом случае речь идет об использовании приемов, не опирающихся на статистическую обработку.

В современной психометрии разработаны десятки разнообразных способов проверки валидности диагностических методик, обусловленных их особенностями, а также временным статусом внешнего критерия . Однако чаще всего называются следующие способы.

1. Валидность "по содержанию" означает, что методика является валидной по мнению специалистов. Этот прием используется, например, в тестах достижений. Обычно в тесты достижений включается не весь материал, который прошли учащиеся, а какая-то его небольшая часть (3-4 вопроса). Можно ли быть уверенным в том, что правильные ответы на эти немногие вопросы свидетельствуют об усвоении всего материала? На это и должна ответить проверка валидности по содержанию. Для этого проводится сопоставление успешности по тесту с экспертными оценками учителей (по данному материалу). Валидность "по содержанию" также подходит критериально-ориентированным тестам, поскольку в них используются экспертные методы. Специфичным является объект экспертизы - содержание теста. Эксперты должны оценить содержание заданий теста по их соответствию психическому свойству, объявляемому в качестве содержания валидизируемого теста. С этой целью экспертам предъявляются спецификация к тесту и список заданий. Если конкретное задание полностью соответствует спецификации, то эксперт обозначает его как соответствующее содержанию теста. Иногда этот прием называют логической валидностью или "валидностью по определению". .
2. Валидность "по одновременности", или текущая валидность, определяется с помощью внешнего критерия, по которому информация собирается одновременно с экспериментами по проверяемой методике. Другими словами, собираются данные, относящиеся к настоящему времени: успеваемость в период испытания, производительность в этот же период и т.д. С ними сопоставляют результаты успешности по тесту.
3. "Предсказывающая" валидность (другое название - "прогностическая" валидность). Определяется также по внешнему критерию, но информация по нему собирается некоторое время спустя после испытания. Хотя этот прием наиболее соответствует задаче диагностических методик - предсказанию будущей успешности, применять его очень трудно. Точность диагноза находится в обратной зависимости от времени, заданного для такого прогнозирования. Чем больше проходит времени после измерения, тем большее количество факторов требуется учитывать при оценке прогностической значимости методики. Однако учесть все факторы, влияющие на предсказание, практически невозможно.
4. "Ретроспективная" валидность. Она определяется на основе критерия, отражающего события или состояние качества в прошлом. Может быть использована для быстрого получения сведений о предсказательных возможностях методики. Так, для проверки того, в какой мере хорошие результаты теста способностей соответствуют быстрому обучению, можно сопоставить прошлые оценки успеваемости, прошлые экспертные заключения и т.д. у лиц с высокими и низкими на данный момент диагностическими показателями.

При приведении данных о валидности разработанной методики важно точно указать, какой вид валидности имеется в виду (по содержанию, по одновременности и т.д.). Желательно также сообщать сведения о численности и особенностях индивидов, на которых проводилась валидизация. Такая информация позволяет пользующемуся методикой психологу решить, насколько валиден этот прием для той группы, к которой он собирается его применять. Как и в случае с надежностью, необходимо помнить, что в одной выборке методика может обладать высокой валидностью, а в другой - низкой. Поэтому если исследователь планирует использовать методику на выборке испытуемых, существенно отличающейся от той, на которой проводилась проверка валидности, ему необходимо заново провести такую проверку. Приводимый в руководстве коэффициент валидности применим только к группам испытуемых, подобным тем, на которых он определялся.

Анастази А. Психологическое тестирование: в 2 т. М, 1982.

Гуревич К. М. Указ. соч.

Анастази А. Психологическое тестирование: в 2 т. М., 1982 ; Бурлачук Л. Ф., Морозов С. М. Словарь-справочник но психологической диагностике. Киев. 1989; Гуревич К. М. Указ. соч.; Общая психодиагностика / под ред. Л. Л. Бодалева, В. В. Столица.

Печать

Также интересно:

Dark Sector: Прохождение Глава VIII: Неестественная история

Что делать если на компе нету диска D?

Как откатить или удалить проблемное обновление Windows Откат к предыдущей сборке windows 10

Рекомендуем почитать:

2023-08-11 00:02:15

Оператор для работы с наборами UNION Объединение запросов union

2023-08-11 00:02:15

IBM создала самый мощный в мире компьютер Топ 10 самых мощных компьютеров в мире

2023-08-10 00:03:18

Мы знаем далеко не все: какие социальные сети существуют в интернете Путешествия и отдых

В продолжение темы:

Windows

Компьютеры с процессором intel i5 Конфигурация тестовых стендов

Часть вторая : "Важнейшие характеристики каждого семейства процессоров Intel Core i3/i5/i7. Какие из этих чипов представляют особый интерес" Введение Сначала мы приведём...

Новые статьи