Дом
Раскрытие наших «скрытых посещений» с помощью данных и машинного обучения мобильного телефона и машинного обучения
Если вы когда-либо задумывались, как исследователи отслеживают наши перемещения по стране, не полагаясь исключительно на телефонные звонки, увлекательное исследование ученых из Китая и США дает некоторые ответы. Их совместная работа посвящена использованию машинного обучения для выявления «скрытых визитов» — тех поездок, которые не отображаются в стандартных телекоммуникационных данных, потому что мы недостаточно активно используем свои телефоны.
Исследование, озаглавленное **Выявление скрытых визитов из разреженных данных записей вызовов**, возглавляет Чжан Чжао из Университета Гонконга совместно с Харисом Н. Кутсопулосом из Северо-Восточного университета в Бостоне и Джинхуа Чжао из MIT. Их цель? Использовать записи мобильной активности — такие как мобильные данные, SMS и голосовые звонки — от высокоактивных пользователей для моделирования и прогнозирования моделей перемещений тех, кто использует свои телефоны реже.
*Примерная схема извлечения информации о поездках из данных записей вызовов (CD).* Источник: https://arxiv.org/pdf/2106.12885.pdf
Хотя команда признает потенциальные проблемы с конфиденциальностью, которые вызывает их работа, они подчеркивают, что их цель — получить более обобщенное понимание моделей перемещений, а не сосредотачиваться на индивидуальных маршрутах. Они также отмечают, что данные записей вызовов (CDR), которые являются основой таких исследований, имеют свои ограничения. Они часто имеют низкое пространственное разрешение и подвержены «шумам позиционирования» из-за изменения положения пользователя относительно вышек сотовой связи. Однако они утверждают, что эта неточность фактически служит защитой конфиденциальности:
**«Целевое применение нашего исследования — это обнаружение поездок и оценка OD$$ \* $$, которые проводятся на агрегированном уровне, а не на индивидуальном. Разработанные модели могут быть напрямую внедрены на серверы баз данных телекоммуникационных операторов без необходимости передачи данных. Кроме того, по сравнению с другими формами больших данных, такими как данные социальных сетей или транзакций по кредитным картам, данные CDR относительно менее навязчивы с точки зрения личной конфиденциальности. Кроме того, ошибка локализации помогает маскировать точное местоположение пользователя, обеспечивая дополнительный уровень защиты конфиденциальности.»**
Интервалы прошедшего времени (ETI)
Когда мы перемещаемся с мобильными телефонами, не обязательно смартфонами, ограничения данных CDR как инструмента для точного определения местоположения становятся очевидными. Интервалы прошедшего времени (ETI), те периоды во время поездки, когда мы не совершаем и не принимаем звонки, являются ключевыми маркерами для отслеживания наших перемещений. Эти интервалы «тишины» могут временно заставить нас исчезнуть из сети.
Исследователи подчеркивают, как эти пробелы мешают аналитическим системам, пытающимся осмыслить маршруты A>B. Разреженность данных может скрывать «незамеченную поездку». Их новый метод решает эту проблему, анализируя пространственно-временной контекст ETI и учитывая «индивидуальные характеристики пользователя».
Набор данных
Для создания основного тренировочного набора исследователи использовали данные от крупного оператора сотовой связи в китайском городе с населением 6 миллионов. Этот набор данных включал более двух миллиардов транзакций мобильных телефонов от трех миллионов пользователей в ноябре 2013 года, сосредоточившись исключительно на записях голосовых звонков и доступа к данным. Примечательно, что они не включали данные SMS, что усложнило задачу работы с разреженными данными.
Данные включали зашифрованный уникальный идентификатор, код зоны местоположения (LAC), временную метку, идентификатор сотового телефона, связанный с LAC, для определения конкретной вышки сотовой связи, участвующей в транзакции, и идентификатор события, указывающий, был ли это исходящий/входящий звонок или использование данных.
*Дерево процессов для выявления скрытых визитов.*
Эта информация была сопоставлена с базой данных операций вышек сотовой связи, что позволило исследователям определить координаты долготы и широты вышки, связанной с каждым событием связи. Они выявили 9000 вышек сотовой связи в наборе данных.
Исследователи отметили сложность точного определения пунктов назначения поездок, основываясь только на записях вызовов, поскольку эти записи достигают пика утром и днем, что соответствует типичным моделям поездок. Поскольку телефонные звонки могут предшествовать поездке и даже инициировать ее, это может искажать оценку пункта назначения.
*Модели использования мобильных устройств в течение дня.*
Аналогичные проблемы возникают с инициированным пользователем использованием данных, например, приложениями для обмена сообщениями. Однако именно «автоматизированное» использование данных — например, систематический опрос API для получения новых сообщений или других данных, включая GPS и телеметрию в приложениях, — помогает выявить эти скрытые перемещения.
Обработка
Исследователи применили различные классификаторы машинного обучения для решения этой проблемы, включая логистическую регрессию, машины опорных векторов (SVM), случайные леса и подход ансамбля градиентного бустинга. Они были реализованы на Python с использованием scikit-learn с настройками по умолчанию.
Среди них логистическая регрессия обеспечила наиболее интерпретируемые параметры модели. Команда также обнаружила, что более длинные ETI увеличивали вероятность скрытого визита, с более высокой частотой утром. Напротив, когда данные CDR пользователя четко показывали большое количество пунктов назначения или промежуточных точек, вероятность скрытого визита была ниже. Это открытие поддерживает основной принцип их исследования — что наиболее активные пользователи предоставляют детализированную картину своих перемещений, из которой можно вывести поведение менее активных пользователей.
В своем заключении исследователи предполагают, что их подход может быть применен к другим типам транспортных данных, таким как данные смарт-карт и геолокированная информация из социальных сетей.
Исследование было поддержано финансированием от Energy Foundation China и China Sustainable Transportation Center.
*\* Происхождение-Пункт назначения*
Связанная статья
Компания «Байер» использует технологию Iambic AI для ускорения разработки лекарственных препаратов
Доктор Юрген Экхардт занимает должность руководителя отдела развития бизнеса и лицензирования в компании «Байер Фарма».Компания «Байер» использует возможности компании Iambic Therapeutics для внедрени
На Meta подали иск в связи с нарушением конфиденциальности при использовании очков с ИИ: по сообщениям, сотрудники просматривали контент с откровенными сценами
Компания Meta столкнулась с новым судебным иском, связанным с нарушением конфиденциальности при использовании ее умных очков с искусственным интеллектом. Согласно расследованию шведских газет, сотрудн
Оптимизация-ориентированный ИИ становится новым путем к универсальным моделям
Исследователи из Университета Иллинойса в Урбана-Шампейне и Университета Вирджинии создали новую архитектуру модели, которая может открыть путь к созданию более устойчивых систем искусственного интелл
Рекомендации по связанным специальным темам
Комментарии (20)
Die Studie zeigt echt spannend, wie sich Bewegungsmuster aus Mobilfunkdaten extrahieren lassen. Gleichzeitig wirft das aber auch Datenschutzfragen auf – wer kontrolliert eigentlich, wie diese Infos genutzt werden? 🧐
Wait, so they're using ML to track our 'hidden visits' now? 😅 Always feels a bit creepy when tech peeks into those unregistered trips... but the data insights could be huge for urban planning or disease tracking, right? Still, makes me side-eye my phone a little more today 🧐
This study on tracking movements with phone data is wild! 😲 It’s like our phones are secretly spilling where we’ve been. Kinda creepy, but super cool how machine learning digs into those 'hidden visits.' Makes me wonder what else they can find out!
This article blew my mind! Using phone data and ML to track hidden visits is so cool, but kinda creepy too. 🤯 Wonder how they balance privacy with all this tech wizardry.
Если вы когда-либо задумывались, как исследователи отслеживают наши перемещения по стране, не полагаясь исключительно на телефонные звонки, увлекательное исследование ученых из Китая и США дает некоторые ответы. Их совместная работа посвящена использованию машинного обучения для выявления «скрытых визитов» — тех поездок, которые не отображаются в стандартных телекоммуникационных данных, потому что мы недостаточно активно используем свои телефоны.
Исследование, озаглавленное **Выявление скрытых визитов из разреженных данных записей вызовов**, возглавляет Чжан Чжао из Университета Гонконга совместно с Харисом Н. Кутсопулосом из Северо-Восточного университета в Бостоне и Джинхуа Чжао из MIT. Их цель? Использовать записи мобильной активности — такие как мобильные данные, SMS и голосовые звонки — от высокоактивных пользователей для моделирования и прогнозирования моделей перемещений тех, кто использует свои телефоны реже.
*Примерная схема извлечения информации о поездках из данных записей вызовов (CD).* Источник: https://arxiv.org/pdf/2106.12885.pdf
Хотя команда признает потенциальные проблемы с конфиденциальностью, которые вызывает их работа, они подчеркивают, что их цель — получить более обобщенное понимание моделей перемещений, а не сосредотачиваться на индивидуальных маршрутах. Они также отмечают, что данные записей вызовов (CDR), которые являются основой таких исследований, имеют свои ограничения. Они часто имеют низкое пространственное разрешение и подвержены «шумам позиционирования» из-за изменения положения пользователя относительно вышек сотовой связи. Однако они утверждают, что эта неточность фактически служит защитой конфиденциальности:
**«Целевое применение нашего исследования — это обнаружение поездок и оценка OD$$ \* $$, которые проводятся на агрегированном уровне, а не на индивидуальном. Разработанные модели могут быть напрямую внедрены на серверы баз данных телекоммуникационных операторов без необходимости передачи данных. Кроме того, по сравнению с другими формами больших данных, такими как данные социальных сетей или транзакций по кредитным картам, данные CDR относительно менее навязчивы с точки зрения личной конфиденциальности. Кроме того, ошибка локализации помогает маскировать точное местоположение пользователя, обеспечивая дополнительный уровень защиты конфиденциальности.»**
Интервалы прошедшего времени (ETI)
Когда мы перемещаемся с мобильными телефонами, не обязательно смартфонами, ограничения данных CDR как инструмента для точного определения местоположения становятся очевидными. Интервалы прошедшего времени (ETI), те периоды во время поездки, когда мы не совершаем и не принимаем звонки, являются ключевыми маркерами для отслеживания наших перемещений. Эти интервалы «тишины» могут временно заставить нас исчезнуть из сети.
Исследователи подчеркивают, как эти пробелы мешают аналитическим системам, пытающимся осмыслить маршруты A>B. Разреженность данных может скрывать «незамеченную поездку». Их новый метод решает эту проблему, анализируя пространственно-временной контекст ETI и учитывая «индивидуальные характеристики пользователя».
Набор данных
Для создания основного тренировочного набора исследователи использовали данные от крупного оператора сотовой связи в китайском городе с населением 6 миллионов. Этот набор данных включал более двух миллиардов транзакций мобильных телефонов от трех миллионов пользователей в ноябре 2013 года, сосредоточившись исключительно на записях голосовых звонков и доступа к данным. Примечательно, что они не включали данные SMS, что усложнило задачу работы с разреженными данными.
Данные включали зашифрованный уникальный идентификатор, код зоны местоположения (LAC), временную метку, идентификатор сотового телефона, связанный с LAC, для определения конкретной вышки сотовой связи, участвующей в транзакции, и идентификатор события, указывающий, был ли это исходящий/входящий звонок или использование данных.
*Дерево процессов для выявления скрытых визитов.*
Эта информация была сопоставлена с базой данных операций вышек сотовой связи, что позволило исследователям определить координаты долготы и широты вышки, связанной с каждым событием связи. Они выявили 9000 вышек сотовой связи в наборе данных.
Исследователи отметили сложность точного определения пунктов назначения поездок, основываясь только на записях вызовов, поскольку эти записи достигают пика утром и днем, что соответствует типичным моделям поездок. Поскольку телефонные звонки могут предшествовать поездке и даже инициировать ее, это может искажать оценку пункта назначения.
*Модели использования мобильных устройств в течение дня.*
Аналогичные проблемы возникают с инициированным пользователем использованием данных, например, приложениями для обмена сообщениями. Однако именно «автоматизированное» использование данных — например, систематический опрос API для получения новых сообщений или других данных, включая GPS и телеметрию в приложениях, — помогает выявить эти скрытые перемещения.
Обработка
Исследователи применили различные классификаторы машинного обучения для решения этой проблемы, включая логистическую регрессию, машины опорных векторов (SVM), случайные леса и подход ансамбля градиентного бустинга. Они были реализованы на Python с использованием scikit-learn с настройками по умолчанию.
Среди них логистическая регрессия обеспечила наиболее интерпретируемые параметры модели. Команда также обнаружила, что более длинные ETI увеличивали вероятность скрытого визита, с более высокой частотой утром. Напротив, когда данные CDR пользователя четко показывали большое количество пунктов назначения или промежуточных точек, вероятность скрытого визита была ниже. Это открытие поддерживает основной принцип их исследования — что наиболее активные пользователи предоставляют детализированную картину своих перемещений, из которой можно вывести поведение менее активных пользователей.
В своем заключении исследователи предполагают, что их подход может быть применен к другим типам транспортных данных, таким как данные смарт-карт и геолокированная информация из социальных сетей.
Исследование было поддержано финансированием от Energy Foundation China и China Sustainable Transportation Center.
*\* Происхождение-Пункт назначения*
Компания «Байер» использует технологию Iambic AI для ускорения разработки лекарственных препаратов
Доктор Юрген Экхардт занимает должность руководителя отдела развития бизнеса и лицензирования в компании «Байер Фарма».Компания «Байер» использует возможности компании Iambic Therapeutics для внедрени
На Meta подали иск в связи с нарушением конфиденциальности при использовании очков с ИИ: по сообщениям, сотрудники просматривали контент с откровенными сценами
Компания Meta столкнулась с новым судебным иском, связанным с нарушением конфиденциальности при использовании ее умных очков с искусственным интеллектом. Согласно расследованию шведских газет, сотрудн
Оптимизация-ориентированный ИИ становится новым путем к универсальным моделям
Исследователи из Университета Иллинойса в Урбана-Шампейне и Университета Вирджинии создали новую архитектуру модели, которая может открыть путь к созданию более устойчивых систем искусственного интелл
Die Studie zeigt echt spannend, wie sich Bewegungsmuster aus Mobilfunkdaten extrahieren lassen. Gleichzeitig wirft das aber auch Datenschutzfragen auf – wer kontrolliert eigentlich, wie diese Infos genutzt werden? 🧐
Wait, so they're using ML to track our 'hidden visits' now? 😅 Always feels a bit creepy when tech peeks into those unregistered trips... but the data insights could be huge for urban planning or disease tracking, right? Still, makes me side-eye my phone a little more today 🧐
This study on tracking movements with phone data is wild! 😲 It’s like our phones are secretly spilling where we’ve been. Kinda creepy, but super cool how machine learning digs into those 'hidden visits.' Makes me wonder what else they can find out!
This article blew my mind! Using phone data and ML to track hidden visits is so cool, but kinda creepy too. 🤯 Wonder how they balance privacy with all this tech wizardry.











