CatЕсли у вас есть подробная статистика посещений различных сайтов пользователями, включающая некоторые уникальные идентификаторы, то вы можете построить для этих идентификаторов профили, включающие “расписания” перемещений пользователей по сайтам. Конечно, каждому пользователю может соответствовать несколько идентификаторов. Но, оказывается, идентификаторы можно склеить, так как у пользователей есть индивидуальные привычки и “расписания” просмотра сайтов.

Например, пользователь имярек утром просматривает новостные сайты, из некоторой подборки, интересуясь определёнными тематиками, днём использует корпоративный и справочные сайты, а вечером – развлекательные. “Расписание” может быть индивидуализировано и при помощи такого параметра, как время, проведённое на сайте. Теперь логично предположить, что идентификаторы, имеющие одинаковые “расписания”, принадлежат одному и тому же реальному пользователю, просто он заходит в Интернет с разных рабочих мест. Действительно, люди хоть и похожи друг на друга, но весьма индивидуальны в своих привычках и предпочтениях.

Аналогичный метод работает во многих других случаях, позволяя склеивать разрозненные наборы технических следов в один “трек”, оставленный конкретным человеком. Предположим, что кто-то сменил телефонный номер, телефонный аппарат и SIM-карту. Но он наверняка продолжает звонить тем же людям, что и раньше, соответственно, новые “телефонные реквизиты” несложно персонализировать. Кто-то поменял банковскую карту, но продолжает покупать традиционный набор продуктов по старому расписанию – можно смело склеивать истории, даже если у вас нет доступа к персональным данным держателя карты.

Интересно, что чем больше накоплено разнородных информационных следов, тем больше возникает возможностей по их индивидуализации. Ну и тем меньше шансов затеряться у того, кто пытается скрыться.



Комментарии (8) »

Abacus. Credit:  aussiegall, Flickr.comВ связи с изменениями в законодательстве, обсуждают то, как можно определить, что тот или иной сайт (блог) посещает более трёх тысяч пользователей в сутки. Конечно, вариант с использованием некоторого веб-счётчика – он не самый подходящий, прежде всего потому, что требуется наличие счётчика на страницах сайта. Некоторые владельцы ресурсов полагают, что данные о посещаемости известны только веб-мастеру или администратору сервера (хостинг-провайдеру). Это не так.

Определить посещаемость можно при помощи анализа HTTP-трафика, проводимого на сетях провайдеров доступа (либо на точках обмена трафиком, что неплохо подходит для российского сегмента Интернета). То есть, нужно использовать DPI. Наблюдая за трафиком, относительно несложно посчитать число заходов браузеров на заданный ресурс. Думаю, основная идея метода достаточно очевидна: считаются GET-запросы, содержащие заданный URL. Не обязательно даже следить за всем потоком трафика: полные данные можно вычислить по некоторой выборке.

Есть ещё дополнительные косвенные методы. Например, запросы к серверам DNS, скажем, к корневым. Частота запросов о заданном имени хоста (об адресе сайта) связана с посещаемостью этого сайта. Правда, запросы выполняют рекурсивные резолверы, поэтому собранную статистику нужно “нормировать” по числу клиентов, обслуживаемых тем или иным резолвером. (Последняя величина, кстати, тоже косвенно определяется из наблюдений за DNS-запросами, а точнее – за вариативностью этих запросов, приходящих от разных резолверов; грубо говоря, данные выдаёт “дисперсия”, но это детали.)

Другое дело, что такое понятие, как “посещение сайта интернет-пользователем”, – оно очень размыто, для него нет определения. Это одна из фундаментальных проблем всякой веб-аналитики: строго говоря, пользователи никогда не заходят на сайты – это делают их компьютеры. Можно подумать, что это излишняя придирка к терминам, но это не так: представьте, что персональный компьютер без ведома пользователя заражён вредоносной программой, и запросы к сайтам делает именно эта программа. Результат запроса пользователю не показывается, то есть он заведомо не просматривает страниц. Нередкая ситуация в современной сетевой реальности.

Для того, чтобы получить хоть какую-то уверенность, что за компьютером сидит живой человек, нужно проделать дополнительные фокусы: мы все о них хорошо знаем – это и капчи, и авторизация, и наблюдение за действиями пользователя на сайте, включая фиксирование путей указателя мыши, интервалов времени и тому подобных штук. Это действительно проблема. Впрочем, примерному определению посещаемости она, похоже, не препятствует.



Комментарии (2) »

На днях в издательстве “Эксмо” вышла моя новая книга о системе доменных имён (DNS). У неё простое название – “Домены”. Это, фактически, дальнейшее развитие “Доменных войн”, которые пережили два издания. Из основных дополнений – рассказ о программе New gTLD, изменения в работе ICANN, реальность внедрения DNSSEC.



Comments Off on Новая книга о доменах

PhoneПишут, что исследователям удалось добиться практической идентификации конкретных экземпляров смартфонов по отпечаткам работы их акселерометров. Надо сказать, что идея довольно очевидная: всякое электронное устройство обладает тем или иным уникальным отпечатком, который, теоретически, можно вычислить. В случае со смартфоном, не очень понятно, что даёт очередной внутренний аппаратный идентификатор – приложение, запущенное на смартфоне, и так имеет разнообразные возможности по идентификации этого конкретного устройства. (Впрочем, в тексте по ссылке упоминается ещё один сценарий использования данных акселерометра – определение того, чем в данный момент занят человек – носитель смартфона.)

Понятно, что подобных инструментов идентификации будет теперь появляться всё больше. Наибольший интерес представляют те из них, которые доступны для удалённого анализа. Удобно, кстати, что dxdt.ru работает уже некоторое время: можно очередной раз сослаться на старую записку – так, про идентификацию электронных устройств по отпечаткам я писал около шести лет назад. Что ж, теория потихоньку переходит в практику.



Comments Off on Идентификация смартфона через “отпечатки” датчиков

Сделал отдельный поиск по запискам, опубликованным на dxdt.ru. Это просто поиск “Яндекса” для сайта (вроде бы, пока там не показывается реклама), поэтому – отдельный поддомен и веб-сервер. Адрес: search.dxdt.ru.



Comments Off on Поиск по запискам dxdt.ru – search.dxdt.ru

Оказывается, “Компьюлента” – всё, закончилась:

“Этим материалом «Компьюлента» заканчивает свою нынешнюю историю, совершенно не ведая, что ждёт её в будущем и ждёт ли вообще. Спасибо, что были с нами. Вы были хорошие, а мы, наверное, не очень. Прощайте.”



Комментарии (2) »

Для дистрибутива Fedora Linux планируют внедрение локального DNS-резолвера, валидирующего DNSSEC. Этот резолвер предлагается использовать по умолчанию. То есть, дистрибутив будет проводить проверку адресной информации непосредственно на клиенте, что обозначает завершающий этап развёртывания технологии DNSSEC. Естественно, только обозначает: потому что для окончания данного этапа – мы должны увидеть локальную валидацию по умолчанию в распространённых клиентских системах (ни Fedora, ни Linux к таким, к сожалению, не относятся).

Кстати, напомню, что я как-то сделал небольшой сервис для проверки средствами браузера того, поддерживается ли DNSSEC вашим системным окружением.



Комментарии (4) »

В свете очередных сообщений СМИ о планах “преобразования” национального сегмента Сети, вот что нужно сказать: в идеальном мире адекватным ответом на попытки получения тотального доступа к пользовательским данным одной из сторон, действующей в глобальной Сети, было бы не огораживание “на своих серверах”, а разработка и продвижение технологий, сохраняющих приватность пользовательских данных в условиях “открытого” Интернета. Существующий математический аппарат позволяет так устроить протоколы и архитектуру сервисов, что у каждого пользователя будет контроль над доступом к его данным, вне зависимости от того, на каких серверах глобальной Сети они вдруг находятся.

То же самое касается и угроз по отключению национального сегмента Интернета извне – здесь адекватным решением, в идеальном мире, также является не огораживание, а создание технологии распределения национального сегмента по всей Сети так, чтобы отключить его можно было только вместе со всеми остальными сегментами. Опять же, теоретический аппарат для таких технологий – есть.

Да.

Наш мир, конечно, не идеален.

(Политические комментарии – буду удалять. Надеюсь на понимание.)



Комментарии (7) »

Несколько часов назад в корне DNS делегированы столичные домены moscow и москва (кириллический). Проверить, как они работают, можно здесь:

http://nic.moscow/
http://nic.москва/



Комментарии (4) »

BooksНекоторое время назад я оценивал, сколько нужно хранить трафика, чтобы иметь более или менее полный слепок пользовательской активности в Рунете за 12 часов (отдельная записка посвящена тому, как этот трафик принимать и обрабатывать). Сейчас актуальная тема – хранение неких “метаданных”, под которыми подразумевается лог действий в некоторой “системе обмена сообщениями”. Лог доступен за период в шесть месяцев. Сколько требуется пространства для решения этой задачи?

Если оценивать нижний предел, то совсем немного. Естественно, всё зависит от того, насколько детальные метаданные требуется сохранять. Пусть записываются только факты “контакта” между пользователями, взятые с точностью до суток. Под “контактом” подразумевается отправка сообщений: если отправлено одно или более сообщений – значит, был контакт в заданные сутки (число сообщений и направление передачи – не уичтываем). Предположим, что типичный пользователь в сутки контактирует с десятком других пользователей (это вполне реальный показатель).

Итак, для перечисления интернет-пользователей всякой популярной системы достаточно 32 бит или четырёх байтов (2^32 это примерно 4,2 млрд), поэтому запись идентификаторов для контактов заданного пользователя потребует 4*10=40 байтов за сутки. Добавляем сюда отпечатки времени – 3 байта на запись (с точностью до секунд в сутках + служебные биты). Получаем: 40+3*10=70 байтов за сутки. Очень мало. (Можно легко засунуть сюда и тип используемых сервисов, кстати.)

Рассмотрим другое, более технологичное, представление, где контакт – это пара идентификаторов и метка времени (ID1,ID2,T): 4+4+3=11 байтов на запись, а записи хранятся в единой БД, общим потоком. Если посмотреть на такую структуру данных, взятую “по модулю” одного пользователя, то получим оценку в 110 байтов в сутки на пользователя (естественно, тут есть простор для оптимизации). То есть, за 180 дней (примерно шесть месяцев): 180*110=19800 – около 20 килобайт данных за сутки на каждого пользователя. Для десяти миллионов – всего-то 200 гигабайт (без оптимизации кодирования, заметьте).

Конечно, нужно сохранять персональную информацию о каждом пользователе, чтобы можно было сопоставить идентификаторы с персонами. Но эти данные редко изменяются, да и места совсем не занимают.

Другое дело, если требуется хранить подробный лог, в котором, например, отражено, как именно взаимодействовали пользователи, куда каждый из них ходил, сколько сообщений отправил, что нажимал, сколько времени провёл за тем или иным занаятием. В таком случае необходимый объём данных легко вырастет на два порядка. А ведь занятно, что и 20 терабайт (200Gb*100) – тоже не выглядят пугающе.



Комментарии (4) »

Из печати вышел очередной номер журнала “Доменные имена”. Кроме других интересных материалов, там есть моя небольшая статья про безопасность в “Интернете вещей”, а точнее – про угрозы, связанные с подобными интернетами. Номер (бесплатно) можно получить на конференции РИФ-2014, если вдруг кто там будет (я – нет). А также в московском офисе RU-CENTER и в офисах региональных представителей RU-CENTER.

Иллюстрация: Сергей Ратников



Comments Off on Новые “Доменные имена”