Развитие Physical AI сегодня уткнулось в отсутствие достаточного количества данных. Если для обучения VLM мы могли взять огромный объем текстовой информации, который годами копился в интернете, то VLA и world‑action-модели кормить практически нечем, создавать новые датасеты для обучения…
Среди всех разновидностей роботов гуманоидные привлекают наибольшее внимание. Все интересующиеся робототехникой наблюдают за новыми падениями Atlas и смотрят дебаты гуманоидных роботов о том, какое будущее ждет человечество, а в сети можно найти множество интервью с самым…
Мы в Контуре собрали собственный датасет и использовали его для обучения детектора, ориентированного на работу в сценариях видеосвязи. В статье расскажем, откуда брали материалы, как организовали сбор и тегирование, как генерировали фейки и почему важно заранее продумывать систему тегов. Датасет открыт для сообщества, ссылки оставили в конце статьи. Читать далее
Я собрал датасет метаданных по ~40 млн публичных репозиториев GitHub. Внутри — звёзды, форки, лицензии, язык, описание, размер, дата создания и др. Схема по смыслу максимально совместима с GH Archive/GitHub API. Лицензия — MIT. Ниже — как скачать, что внутри и идеи использования.Датасет: ibragim-bad/github-repos-metadata-40M Читать далее