25 марта вышла новая модель Gemini 2.5 Pro от Google. Много уже было про нее сказано, но я стараюсь не обращать внимания на волны хайпа вокруг новинок, ориентируясь на свои доверенные источники. Одним из них является любительский бенчмарк SimpleBench, который тестирует здравый смысл в реальной жизни. Он интересен тем, что в нем самый обычный человек набирает 83.7%, а рекорд для LLM еще недавно был лишь 46.4%. Читать далее
Модели OpenAI серии o1 — это новые большие языковые модели, обученные с помощью подкрепления для выполнения сложных рассуждений. Модели o1 думают, прежде чем ответить, и могут создавать длинную внутреннюю цепочку рассуждений, прежде чем ответить пользователю.В статье об ограничениях бета-версии, о том, как работает новая модель OpenAI, особенностях промптинга и других тонкостях. Читать далее
В этой статье мы сравним передовые подписочные модели от Anthropic, OpenAI и Google для целей литературного перевода, редактирования и сверки. А конкретнее — Google (gemini-3.7-flash и gemini-3.1-pro), Anthropic (claude-opus-5) и OpenAI (gpt-5.6-sol): кто чище переводит, кто внимательнее редактирует и кому можно доверить вердикт «ошибся автор или перевод».Все сравнения проводились внутри опенсурсного конвейера BookTrans, о котором уже рассказывалось на Хабре. Читать далее
Google добавила к семейству Gemini еще три модели - и тем самым лишь сильнее подчеркнула отсутствие самой ожидаемой.Новые модели Flash решают быстрые, доступные и защитные задачи, а Gemini 4 уже проходит самое масштабное предварительное обучение за всю историю проекта. Однако Gemini 3.5 Pro, призванная конкурировать с лидерами рынка, все еще находится на стадии тестирования. Читать далее