Шок: новая ИИ-модель GeoVista точно определяет геолокацию съёмки по фото
2025-12-08 14:51
Китайские исследователи представили GeoVista — открытую модель геолокации по снимку, по качеству работы уже приближающуюся к коммерческим решениям вроде Gemini 2.5 Flash. В отличие от большинства аналогов, GeoVista не ограничивается анализом самого изображения: она самостоятельно ищет информацию в сети, увеличивает важные фрагменты на фото и сравнивает их с контентом из открытых источников.
Проект создан Tencent совместно с несколькими китайскими университетами. Модель опирается на два ключевых инструмента:
умный зум, позволяющий детально рассматривать надписи, знаки и архитектурные особенности;
встроенный веб-поиск, который подбирает до десяти релевантных источников с платформ вроде Tripadvisor, Instagram*, Facebook*, Pinterest и Wikipedia.
GeoVista функционирует как агент: она последовательно изучает части изображения, формирует поисковые запросы, сверяет результаты и постепенно уточняет гипотезы, пока не определит максимально вероятную точку съёмки.
В основе системы — архитектура Qwen2.5-VL-7B-Instruct, обученная в два этапа.
Сначала исследователи дали модели около 2000 тщательно подобранных примеров с пояснениями и демонстрацией использования инструментов. Далее последовал этап обучения с подкреплением на 12 000 задач, где система вознаграждалась за более точные географические совпадения — от страны до конкретного города.
На тестах GeoBench GeoVista достигла 92,64 % точности на уровне стран, 79,60 % — на уровне провинций и 72,68 % — на уровне городов. Лучшая производительность отмечена на панорамах и обычных фото, а вот со спутниковыми снимками модель справляется заметно хуже.
Для сравнения, Gemini 2.5 Pro показал 78,98 % точности по городам, GPT-5 — 67,11 %, Gemini 2.5 Flash — 73,29 %. Открытые модели в целом уступают, но GeoVista-7B приблизилась к лидерам удивительно близко.
С точки зрения расстояния до фактической точки съёмки, GeoVista попадает в радиус 3 км в 52,83 % случаев (медианное отклонение — 2,35 км). У Gemini 2.5 Pro этот показатель выше — 64,45 % с медианой около 800 метров, у GPT-5 — 55,12 % и 1,86 км соответственно. Коммерческие модели всё ещё лидируют, но разрыв уже не выглядит непреодолимым.
Эксперименты показали, что обе фазы обучения критически важны: без этапа с контролируемыми примерами модель почти переставала использовать инструменты, а без RL сильно падала точность. Увеличение набора данных также стабильно улучшало результаты.
Вместе с моделью исследователи представили и новый датасет — GeoBench, включающий 1142 изображения высокого качества из 66 стран и 108 городов: 512 обычных фото, 512 панорам и 108 спутниковых снимков. Набор тщательно отфильтрован: удалены «нелокализуемые» кадры и слишком узнаваемые достопримечательности, чтобы тестирование отражало реальные, сложные сценарии геолокации.
GeoBench оценивает модели как по административным уровням (страна → провинция → город), так и по расстоянию до фактической точки, автоматически геокодируя текстовые ответы.
Хотя авторы напрямую не обсуждают риски, вывод очевиден: любой человек, публикующий фотографии в открытом доступе, должен учитывать, что современные ИИ всё лучше умеют определять место съёмки, и вопросы приватности становятся ещё острее.
*принадлежит Meta, признанной экстремистской и запрещённой в РФ