
Ученые из Технологического института Джорджии (США) разработали фреймворк, которых помогает большим языковым моделям (LLM) изучать презентации, брошюры и графики способом, похожим на то, как обычно читают люди. О том, как добиться точности в интерпретации текста, не создавая более мощные модели, рассказывается на сайте университета.
LLM значительно облегчают труд людей и экономят время. Однако малейшая ошибка или незамеченная деталь могут исказить результат и привести к серьезным последствиям. Ученые придумали, как увеличить точность анализа визуальных данных и презентаций.
SlideAgent — фреймворк, который разбивает документ на несколько уровней: весь документ, отдельные страницы и конкретные элементы, такие как диаграммы, таблицы и текстовые блоки. На каждом уровне работает отдельный инструмент, потом SlideAgent объединяет полученные данные. Такой способ, вдохновленный тем, как человек анализирует большое количество сложной информации, помогает быстро изучать документы и отвечать на вопросы.

Ученые протестировали платформу и подтвердили, что она превосходит популярные модели по точности — почти на 10%. Особенно это было заметно при сравнении информации на разных слайдах и анализе соотношения визуальных элементов.
Исследователи доказали, что для достижения точности необязательно создавать более крупные языковые модели. Достаточно продумать эффективные алгоритмы, которые повысят производительность и надежность.
Ранее Наука Mail рассказывала о том, что ИИ помогает заниматься йогой.

