Новости

Шок: новая ИИ-модель GeoVista точно определяет геолокацию съёмки по фото

Китайские исследователи представили GeoVista — открытую модель геолокации по снимку, по качеству работы уже приближающуюся к коммерческим решениям вроде Gemini 2.5 Flash. В отличие от большинства аналогов, GeoVista не ограничивается анализом самого изображения: она самостоятельно ищет информацию в сети, увеличивает важные фрагменты на фото и сравнивает их с контентом из открытых источников.

Проект создан Tencent совместно с несколькими китайскими университетами. Модель опирается на два ключевых инструмента:

  • умный зум, позволяющий детально рассматривать надписи, знаки и архитектурные особенности;
  • встроенный веб-поиск, который подбирает до десяти релевантных источников с платформ вроде Tripadvisor, Instagram*, Facebook*, Pinterest и Wikipedia.

GeoVista функционирует как агент: она последовательно изучает части изображения, формирует поисковые запросы, сверяет результаты и постепенно уточняет гипотезы, пока не определит максимально вероятную точку съёмки.

В основе системы — архитектура Qwen2.5-VL-7B-Instruct, обученная в два этапа.

Сначала исследователи дали модели около 2000 тщательно подобранных примеров с пояснениями и демонстрацией использования инструментов. Далее последовал этап обучения с подкреплением на 12 000 задач, где система вознаграждалась за более точные географические совпадения — от страны до конкретного города.

На тестах GeoBench GeoVista достигла 92,64 % точности на уровне стран, 79,60 % — на уровне провинций и 72,68 % — на уровне городов. Лучшая производительность отмечена на панорамах и обычных фото, а вот со спутниковыми снимками модель справляется заметно хуже.

Для сравнения, Gemini 2.5 Pro показал 78,98 % точности по городам, GPT-5 — 67,11 %, Gemini 2.5 Flash — 73,29 %. Открытые модели в целом уступают, но GeoVista-7B приблизилась к лидерам удивительно близко.

С точки зрения расстояния до фактической точки съёмки, GeoVista попадает в радиус 3 км в 52,83 % случаев (медианное отклонение — 2,35 км). У Gemini 2.5 Pro этот показатель выше — 64,45 % с медианой около 800 метров, у GPT-5 — 55,12 % и 1,86 км соответственно. Коммерческие модели всё ещё лидируют, но разрыв уже не выглядит непреодолимым.

Эксперименты показали, что обе фазы обучения критически важны: без этапа с контролируемыми примерами модель почти переставала использовать инструменты, а без RL сильно падала точность. Увеличение набора данных также стабильно улучшало результаты.

Вместе с моделью исследователи представили и новый датасет — GeoBench, включающий 1142 изображения высокого качества из 66 стран и 108 городов: 512 обычных фото, 512 панорам и 108 спутниковых снимков. Набор тщательно отфильтрован: удалены «нелокализуемые» кадры и слишком узнаваемые достопримечательности, чтобы тестирование отражало реальные, сложные сценарии геолокации.

GeoBench оценивает модели как по административным уровням (страна → провинция → город), так и по расстоянию до фактической точки, автоматически геокодируя текстовые ответы.

Хотя авторы напрямую не обсуждают риски, вывод очевиден: любой человек, публикующий фотографии в открытом доступе, должен учитывать, что современные ИИ всё лучше умеют определять место съёмки, и вопросы приватности становятся ещё острее.


*принадлежит Meta, признанной экстремистской и запрещённой в РФ