Показаны сообщения с ярлыком big data. Показать все сообщения
Показаны сообщения с ярлыком big data. Показать все сообщения

воскресенье, 17 мая 2015 г.

Применение Big Data в Elearning и адаптивное обучение

Автор: Михаил Тресер

В процессе онлайн обучения ученик оставляет за собой четкий след своего пути и успехов. Если проследить за шагами ученика, можно получить массу полезной информации для дальнейшей аналитики и помощи другим ученикам. Сегодня, многие компании научились анализировать такие данные и предоставлять прогнозы касательно дальнейшего продвижения ученика в учебе. Такие системы могут подсказать, каким ученикам нужна помощь и в каких именно темах необходимо оказать поддержку.
Существуют также инструменты для создания подстраивающихся под ученика курсов, которые меняют показываемые ученику материалы в зависимости от его продвижения внутри курса. Все идет к тому, что в ближайшие 5-7 лет большинство систем для профессионального обучения смогут анализировать успехи ученика и на основе полученной статистики подстраиваться под него.
В последние пару лет, большой популярностью среди компаний стало пользоваться направление “Big Data”. Появилось большое количество старт-апов, которые специализируются на сборе, аналитике и работе с “Big Data”. Большие корпорации тоже не отстают и открывают новые подразделения, занимающиеся только этим направлением. Нужно понимать, что в данном случае важно не только собрать большие объемы даты, но и   научиться обрабатывать ее и доставать полезную информацию, предоставляя готовые инструменты и сервисы для компаний и государственных учреждений.
Такие инструменты могут помочь заранее определить сложности, с которыми сталкиваются студенты, улучшить их результаты и персонализировать обучение на самом высоком уровне. Определяя прогресс обучения студента, такие программы могут помочь преподавателю понять, какие студенты могут не пройти курс, чтобы он мог предоставить соотвествующие вспомогательные инструменты и помощь.
Адаптивное обучение будет активно развиваться в ближайшем будущем и все от этого только выиграют. Компании, которые смогут предложить наиболее интересные и актуальные для рынка решения хорошо заработают на этом. Организации, которые начнут применять такие аналитические инструменты в своих системах смогут повысить результаты и продуктивность своих сотрудников и учеников.

пятница, 16 января 2015 г.

Как предсказать увольнение работника по результатам электронного курса

Автор: Эдуард Бабушкин

Представляете идею: человек у нас проходит электронный он лайн курс, что то делает, а мы по результатам курса говорим: это уволится, а этот... попозже уволится...
Ну вот мы приближаемся к этой фантастике.
Аналитика в дистанционном обучении (кейс для работы)
Напомню: в кейсе есть данные оценок удовлетворенности электронным курсом, и есть стаж работы в компании работника.
Сразу результаты
Непараметрическая регрессия показывает значимые различия между "отличниками" (кто ставил "5" за курс) и "хорошистами", "отличниками" и "троечниками" (для спецов сообщаю, что использовал непараметрическую регрессию, учитывая также стаж тех, кто не уволился).
Грустно, что R^2 = 0, 001, но он значим
Посмотрите на статистики
$`3`
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
    6.0   114.8   258.0   425.8   561.0  3570.0

$`4`
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
    2.0   101.0   241.0   402.7   525.0  4513.0

$`5`
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
    1.0   101.0   224.0   368.7   496.0  4743.0

Как предсказать увольнение работника по результатам электронного курса


Те, кто оценивают курс на "4" или "3" работают в компании значимо дольше.
Но обращаю Ваше внимание: данные "грязные", много bullshit, непонятен инициатор увольнения, поэтому еще много вопросов к выводам.

среда, 14 января 2015 г.

Как зависит удовлетворенность электронным курсом от времени его прохождения

Автор: Эдуард Бабушкин.

Порешаем кейс Аналитика в дистанционном обучении.
Напомню, основная идея: посмотреть как время прохождения курса влияет на оценку удовлетворенности этим курсом.

Диаграмма. Распределение времени прохождения курсов



Как зависит удовлетворенность электронным курсом от времени его прохождения
Данные по оценкам такие
     1     2       3      4        5
   63    90   769  5280 22585
Ценность прогноза, безусловно, снижается тем, что у "пятерки" дают три четверти оценок. Тем не менее, мы различия нашли
Данные регрессии следующие (время прохождения курса мы логарифмируем)
lm(formula = log(r1$timec, base = exp(1)) ~ k, data = r1)

Residuals:
    Min      1Q  Median      3Q     Max
-1.2396 -0.5590 -0.0482  0.4218  3.3122

Coefficients:
             Estimate Std. Error t value Pr(>|t|)  
(Intercept) 3.9601884  0.0046702 847.976  < 2e-16 ***
k1          0.2416935  0.0866167   2.790  0.00527 **
k2          0.2267594  0.0730114   3.106  0.00190 **
k3          0.1126549  0.0255257   4.413 1.02e-05 ***
k4          0.0004889  0.0107263   0.046  0.96364  
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 0.7027 on 28870 degrees of freedom
  (19 observations deleted due to missingness)
Multiple R-squared:  0.001263, Adjusted R-squared:  0.001124
F-statistic: 9.125 on 4 and 28870 DF,  p-value: 2.305e-07
Потрясающий R^2?)
И распределение времени по каждому уровню оценки
Как читать диаграмму boxplot - для понимания результатов
Как зависит удовлетворенность электронным курсом от времени его прохождения

понедельник, 12 января 2015 г.

Аналитика в дистанционном обучении (кейс для работы)

Автор: Эдуард Бабушкин.


В ответ на мою просьбу (см. пост Оценка удовлетворенностью электронным курсом (предложение)) мне прислали файл с данными, а я их вам передаю.
Данные реальные! Я только закодировал названия курсов и должностей, чтобы нельзя было по ним догадаться, что это за компания. Сам я пока ничего не считал.

Итак, кейс

У вас есть файл excel в 36 066 строк со следующими переменными
  1. ID пользователя - уникальный код работника
  2. Дата создания - дата прохождения курса
  3. курс - уникальный код курса
  4. позиция - занимаемая должность
  5. Дата рождения - того, кто проходил курс
  6. Дата приёма - на работу учащегося
  7. Дата увольнения - его же дата увольнения (если пустое поле, значит работает)
  8. Оцени удобство перемещения по курсу - оценка логистики курса учащимся
  9. Сколько времени потратил на изучение курса в минутах? Введи число - оценка учащимся времени прохождения курса
  10. Оцени весь курс по пятибальной оценке - оценка курса учащимся
Вопросы к вам:
  • Какие результаты мы можем извлечь из данного файла;
  • Этот же вопрос в другой формулировке: какие гипотезы можно выдвинуть, исходя из имеющихся данных;
  • Посмотрите на данные и скажите, какие данные вызывают недоверие и почему.
Считать пока ничего не надо, просто выдвигайте гипотезы, если вы не умеете посчитать, посчитаю я. Мне важно, чтобы вы научились зряче смотреть на данные.
ПыСы. осторожней качайте файл
Аналитика в дистанционном обучении (данные для анализа)

пятница, 26 декабря 2014 г.

Оценка удовлетворенностью электронным курсом (предложение)

Автор: Эдуард Бабушкин

В продолжение баталий и битв
Видали вот такую фигню в переводчике гугля? Понимаете, что на основе этих рожиц Гугль улучшает сервис?
Оценка удовлетворенностью электронным курсом (предложение)
Кто нибудь у себя в курсах такую хрень ставил?
Насколько я помню, Михаил Протасов говорил (вебинар Практический опыт автоматизации HR-процессов в компании Enter с помощью системы WebTutor), что у них в Энтере разработчикам заложено в KPI получать высокие оценки по оценке курсов.
Предлагаю технологию того, как можно научиться зряче управлять процессом получения высоких оценок обратной связи по курсу.
От вас нужен лог прохождения курса участниками
Лог этот выгружается из курса формата SCORM или TinCan.
Я не знаю, как он выглядит этот лог (я не специалист по SCORM or TinCan)), но подозреваю (по практике работы с другими системами), что это TXT файл, в котором есть переменные
  • session или sessionID
  • userID или типа того
  • time
  • duration
  • response (это как раз про то, как оценил курс)
  • и еще какие нибудь переменные
Я обращаюсь к спецам: я правильно понимаю, что такое в принципе возможно выгрузить из SCORM?
Если вы выгрузите это из SCORM / TinCan
Я могу вам посчитать, какие параметры курса влияют на оценку удовлетворенности курсом.
Например,
  • если собрать инфо по курсам с разной продолжительностью / кол-вом слайдов, мы ответим на вопрос, какое оптимальное время продолжительности обучения с т.з. удовлетворенности курсом. 
  • Мы можем понять, влияет ли факт того, что студент прошел весь курс без перерывов или разбивал его на отрезки, на удовлетворенность курсом.
  • Можно посмотреть связь между удовлетворенностью курсом и характеристиками самих обучаемых (если мы знаем, кто стоит за userID
  • мы можем оценить влияние отдельных решений курса на восприятие курса в целом (если это решение как то выделено в курсе - например, влияет на оценку курса в целом, то, как отвечал на проверочные вопросы обучаемый)
  • ну и т.п...
Я не обсуждаю здесь, насколько это важно бизнесу или нет. Я не обсуждаю целесообразность этой затеи.
Что вы, собственно, можете получить в итоге: в итоге вы понимать, какие факторы позитивно / негативно влияют на оценку удовлетворенностью курсом, создавать курсы с учетом этих знаний и управлять удовлетворенностью курсами, собственно.
Но если вам интересно посмотреть, что получится, пишите edvb()websoft.ru - будем пообсуждать

суббота, 20 декабря 2014 г.

Большие данные вредят образованию?

Автор: Иван Травкин

Своевременный тезис от Ignatia de Waard (выступает на OEB2014): большие данные вредят образованию (буквально “corrupting education”), усугубляя цифровой разрыв. Учебная аналитика — источник инсайтов, пишет она, но эти инсайты необходимо транслировать назад к учащимся, не превращая в собственность крупного бизнеса. Даже если отвлечься от бизнеса, проблема адекватной интерпретации результатов требует серьезной подготовки и понимания всей специфики статистических методов. Опасность вполне реальная. Студент из неблагополучного района может быть заранее классифицирован как “бесперспективный”, а затем безоговорочно отчислен, как только новые данные “подтвердят” статистическую гипотезу. Другая (фундаментальная) проблема — это проблема нормы. Усреднение. Успевать — значит сливаться с толпой (“правильно” сливаться с “правильной” толпой). Далее, интересные мысли насчет трудоустройства выпускников, основной вывод: большие данные не помогут. Все пересказывать не стану, оригинал интереснее и заслуживает (требует) изучения.
Игнатия публикует свои заметки к некоторым докладам на OEB2014. Обратите внимание на заметки к докладу Стивена Даунса. Стивен говорит о персональном обучении, затрагивая проблему больших данных (в контексте учебной аналитики). Кратко: Веб — не платформа для обучения, а совокупность персональных образовательных сред (эта идея стала основой первых МООК в 2008 году). Существует принципиальна разница между большими и персональными (в широком смысле) данными. Большие данные производит толпа, использующая один и тот же сервис. Персональные данные производит учащийся, работающий со множеством сервисов сразу (*моя* история, глубокий анализ). Естественно, данные принадлежат нам, пользователям. Технологическое решение: LPSS (learning and performance support system), что-то вроде “коннектора” ресурсов и сервисов для организации сетей из персональных образовательных сред. Учебная аналитика как сервис: пользователи предоставляют доступ к персональным данным (все разрешения и варианты использования оговариваются), получая аналитику за определенную плату.

вторник, 2 декабря 2014 г.

Репортаж с лекции: Анализируй это: большие данные в образовании

Автор: Эдуард Бабушкин

Кто нибудь смотрел он лайн лекцию Анализируй это: большие данные в образовании?
Фишка в том, что Америку Чарли не открыл, хоть вещал из Нью-Йорка: у нас все сырые данные для анализа есть.
Этот крендель на лекции упоминал про SCORM - а уже есть TinCan.

В чем суть технологии Knewton: они скачивают все учебные активности студента, преподавателя, проявления контента и педагогического дизайна и смотрят, какие из этих сущностей как влияют на успешность прохождения курса.

К этим сущностям можно отнести:
  • промежуточный вопрос в курсе;
  • время чтения слайда;
  • время суток, когда студент вошел в курс;
  • продолжительность учебного видео;
  • количество текста на слайде;
  • количество друзей в компании, которые вместе проходят курс;
  • и т.д. и т.п..

Ближе всех к аналогичной задаче подошел Сергей Федосов из R-style (см. Контроль обучения в реальной среде).
Какое то время назад Сергей Колков (уж прости, Сергей, "сдам" тебя) задался вопросом: а можно ли по обратной связи определить, как успешно студент пройдет курс.
Отвечаю: модель более сложная, чем просто обратная связь.
Но всем данным, которые мы соберем из TinCan - можно
За этим стоит корреляционный анализ, от которого пока вы откерщиваетесь, но который, зараза, стучится в двери)))
Можно отмахнуться от Бабушкина, от тренда не отмахнетесь, самое обидное будет в том, что можно обращаться к таким провайдерам как Knewton, но иметь все возможности для собственного анализа.
Да. И скажу по секрету: лекция была во многом продажей услуг этого продукта. Но я хотя бы свой английский потренировал. Докладываю: где-то % 80 лекции понял сам без переводчика





среда, 3 октября 2012 г.

Аналитика для T&D

Или Зачем матстатистика T&D

Предложили провести вебинар по матстатистике для T&D
Решил прикинуть, в каких ситуациях специалисту по обучению необходима матстатистика
получилось четыре раздела
  • Чтение аналитических отчетов
  • Опросы
  • Определение эффективности обучения
  • Ведение исследований и аналитики

пятница, 10 августа 2012 г.

Зачем нужна модель Киркпатрика

Зачем нужна модель Киркпатрика

Рассуждения про модель Киркпатрика, оценку эффективности обучения, регрессионный анализ и, главное, отношение HR-а к этому.
Вслед вебинару на нашем портале Матстатистика для HR-3
Мы рассматривали сегодня регрессионный анализ. Было при этом максимально человек 25. Что очень мало для нашего портала.
Если бы вебинар был по теме Модель Киркпатрика, уверяю вас, было бы человек 90-120. От чего так? Я не буду отвечать прямо, дабы не обидеть рынок, а поррассуждаю.