Leaders d’opinion

Évaluations de performances pour les modèles de langage à grande échelle

mm
Ajouter Unite.AI à vos sources préférées sur Google

Comprenez le rôle et les limites des évaluations de performances pour les modèles de langage à grande échelle. Explorez les techniques pour développer des modèles de langage robustes.

Les modèles de langage à grande échelle ont gagné une grande popularité ces dernières années. Je veux dire que vous l’avez vu. La capacité exceptionnelle des modèles de langage à grande échelle à comprendre les commandes de langage humain les a rendus parfaitement adaptés pour les entreprises, en soutenant des flux de travail critiques et en automatisant les tâches pour une efficacité maximale. Et, au-delà de la compréhension moyenne de l’utilisateur, il y a tellement plus de choses que les modèles de langage à grande échelle peuvent faire. Et à mesure que notre dépendance à leur égard augmente, nous devons vraiment prêter plus d’attention aux mesures pour assurer l’exactitude et la fiabilité nécessaires. C’est une tâche mondiale qui concerne l’ensemble des institutions, mais dans le domaine des entreprises, il existe désormais plusieurs évaluations de performances qui peuvent être utilisées pour évaluer les performances des modèles de langage à grande échelle dans divers domaines. Ces évaluations peuvent tester les capacités du modèle en termes de compréhension, de logique, de mathématiques, etc., et les résultats déterminent si un modèle de langage à grande échelle est prêt pour le déploiement commercial.

Dans cet article, j’ai rassemblé une liste complète des évaluations de performances les plus populaires pour les modèles de langage à grande échelle. Nous allons discuter de chaque évaluation en détail et voir comment différents modèles de langage à grande échelle s’en tirent face aux critères d’évaluation. Mais tout d’abord, comprenons l’évaluation des modèles de langage à grande échelle en plus de détails.

Qu’est-ce qu’une évaluation de performances pour les modèles de langage à grande échelle ?

Comme les autres modèles d’intelligence artificielle, les modèles de langage à grande échelle doivent également être évalués par rapport à des évaluations de performances spécifiques qui évaluent divers aspects des performances du modèle de langage : connaissance, exactitude, fiabilité et cohérence. La norme implique généralement :

  1. Compréhension des requêtes utilisateur : Évaluation de la capacité du modèle à comprendre avec précision une large gamme de requêtes utilisateur.
  2. Vérification de la sortie : Vérification des réponses générées par l’IA par rapport à une base de connaissances fiable pour garantir qu’elles sont correctes et pertinentes.
  3. Robustesse : Mesure de la façon dont le modèle se comporte avec des entrées ambiguës, incomplètes ou bruyantes.

L’évaluation des modèles de langage à grande échelle donne aux développeurs le pouvoir d’identifier et de résoudre les limitations de manière efficace, afin qu’ils puissent améliorer l’expérience utilisateur globale. Si un modèle de langage à grande échelle est soigneusement évalué, il sera suffisamment précis et robuste pour gérer diverses applications du monde réel, y compris celles avec des entrées ambiguës ou inattendues.

Évaluations de performances

Les modèles de langage à grande échelle sont l’une des technologies les plus complexes à ce jour et peuvent alimenter même les applications les plus complexes. L’évaluation de performances doit donc être tout aussi complexe, en mettant à l’épreuve sa pensée et son exactitude technique.

Une évaluation de performances utilise des ensembles de données spécifiques, des métriques et des tâches d’évaluation pour tester les performances des modèles de langage à grande échelle, et permet de comparer différents modèles de langage à grande échelle et de mesurer leur exactitude, ce qui à son tour stimule les progrès dans l’industrie grâce à de meilleures performances.

Voici quelques-uns des aspects les plus typiques des performances des modèles de langage à grande échelle :

  • Connaissance : La connaissance du modèle doit être testée dans divers domaines. C’est ce que fait l’évaluation de connaissance. Elle évalue comment efficacement le modèle peut rappeler des informations de différents domaines, comme la physique, la programmation, la géographie, etc.
  • Raisonnement logique : Il s’agit de tester la capacité du modèle à « penser » de manière étape par étape et à dériver une conclusion logique, ce qui implique généralement des scénarios où le modèle doit sélectionner la continuation la plus plausible ou l’explication basée sur les connaissances quotidiennes et le raisonnement logique.
  • Compréhension de la lecture : Les modèles doivent être excellents dans l’interprétation du langage naturel, puis générer des réponses en conséquence. Le test ressemble à répondre à des questions basées sur des passages pour évaluer la compréhension, la déduction et la rétention de détails. Comme un test de lecture scolaire.
  • Compréhension du code : Il s’agit de mesurer la compétence du modèle dans la compréhension, la rédaction et le débogage du code. Ces évaluations de performances donnent au modèle des tâches de codage ou des problèmes à résoudre avec précision, souvent couvrant une gamme de langages de programmation et de paradigmes.
  • Connaissances du monde : Pour évaluer la compréhension du modèle des connaissances générales sur le monde. Ces ensembles de données contiennent généralement des questions qui nécessitent une connaissance encyclopédique large pour être répondues correctement, ce qui les distingue des évaluations de connaissances plus spécifiques et spécialisées.

Évaluations de connaissance

MMLU (Compréhension multimodale du langage)

Cette évaluation de performances est conçue pour tester la compréhension du modèle de langage à grande échelle des connaissances factuelles dans divers sujets tels que les humanités, les sciences sociales, l’histoire, l’informatique et même le droit. 57 questions et 15 000 tâches visant à garantir que le modèle a d’excellentes capacités de raisonnement. Cela rend MMLU un outil solide pour évaluer les connaissances factuelles et le raisonnement du modèle de langage à grande échelle dans divers sujets.

Récemment, elle est devenue une évaluation clé pour évaluer les modèles de langage à grande échelle dans les domaines mentionnés. Les développeurs veulent toujours optimiser leurs modèles pour surpasser les autres dans cette évaluation de performances, ce qui en fait une norme de fait pour évaluer le raisonnement avancé et les connaissances dans les modèles de langage à grande échelle. Les grands modèles d’entreprise ont obtenu des scores impressionnants dans cette évaluation de performances, notamment GPT-4-omni à 88,7 %, Claude 3 Opus à 86,8 %, Gemini 1,5 Pro à 85,9 % et Llama-3 70B à 82 %. Les petits modèles ne performent généralement pas aussi bien dans cette évaluation de performances, ne dépassant pas 60-65 %, mais la performance récente de Phi-3-Small-7b à 75,3 % est quelque chose à considérer.

Cependant, MMLU n’est pas sans inconvénients : elle présente des problèmes tels que des questions ambiguës, des réponses incorrectes et un manque de contexte. Et beaucoup pensent que certaines de ses tâches sont trop faciles pour une évaluation appropriée des modèles de langage à grande échelle.

Je voudrais clarifier que les évaluations de performances comme MMLU ne décrivent pas parfaitement les scénarios du monde réel. Si un modèle de langage à grande échelle obtient un excellent score dans celle-ci, cela ne signifie pas nécessairement qu’il est devenu un expert dans le domaine. Les évaluations de performances sont vraiment limitées dans leur portée et s’appuient souvent sur des questions à choix multiple, qui ne peuvent jamais capturer pleinement la complexité et le contexte des interactions du monde réel. Une véritable compréhension nécessite de connaître les faits et d’appliquer ces connaissances de manière dynamique, ce qui implique une pensée critique, la résolution de problèmes et une compréhension contextuelle. Pour ces raisons, les modèles de langage à grande échelle doivent être constamment affinés et mis à jour pour que le modèle conserve la pertinence et l’efficacité de l’évaluation de performances.

GPQA (Évaluation des questions et réponses de niveau universitaire)

Cette évaluation de performances évalue les modèles de langage à grande échelle en termes de raisonnement logique en utilisant un ensemble de données avec seulement 448 questions. Des experts dans le domaine l’ont développé et il couvre des sujets tels que la biologie, la physique et la chimie.

Chaque question passe par le processus de validation suivant :

  1. Un expert dans le même sujet répond à la question et fournit des commentaires détaillés.
  2. L’auteur de la question révise la question en fonction de ces commentaires.
  3. Un deuxième expert répond à la question révisée.

Ce processus peut en fait garantir que les questions sont objectives, exactes et difficiles pour un modèle de langage. Même des chercheurs expérimentés n’obtiennent qu’une précision de 65 % sur ces questions, tandis que GPT-4-omni n’atteint que 53,6 %, mettant en évidence l’écart entre l’intelligence humaine et l’intelligence artificielle.

En raison des exigences de qualification élevées, l’ensemble de données est en fait assez petit, ce qui limite quelque peu sa puissance statistique pour comparer la précision et nécessite de grands effets de taille. Les experts qui ont créé et validé ces questions provenaient d’Upwork, ils ont donc potentiellement introduit des biais basés sur leur expertise et les sujets couverts.

Évaluations de code

HumanEval

164 problèmes de programmation, un véritable test pour les capacités de codage des modèles de langage à grande échelle. C’est HumanEval. Il est conçu pour tester les capacités de codage de base des grands modèles de langage. Il utilise la métrique pass@k pour juger de l’exactitude fonctionnelle du code généré, qui donne la probabilité qu’au moins un des meilleurs exemples de code généré par le modèle de langage à grande échelle passe les tests.

Bien que l’ensemble de données HumanEval inclue des signatures de fonction, des docstrings, des corps de code et plusieurs tests unitaires, il ne couvre pas la gamme complète des problèmes de codage du monde réel, ce qui ne permet pas de tester de manière appropriée la capacité du modèle à générer du code correct pour divers scénarios.

MBPP (Programmation Python de base)

L’évaluation de performances MBPP se compose de 1 000 questions de programmation Python créées par la foule. Ce sont des problèmes de niveau débutant et ils se concentrent sur les compétences de programmation fondamentales. Il utilise des approches de few-shot et de fine-tuning pour évaluer les performances du modèle, les plus grands modèles performant généralement mieux sur cet ensemble de données. Cependant, puisque l’ensemble de données contient principalement des programmes de niveau débutant, il ne représente pas pleinement les complexités et les défis des applications du monde réel.

Évaluations mathématiques

Alors que la plupart des modèles de langage à grande échelle sont très bons pour structurer des réponses standard, le raisonnement mathématique est un problème beaucoup plus important pour eux. Pourquoi ? Parce que cela nécessite des compétences liées à la compréhension des questions, à une approche logique étape par étape avec un raisonnement mathématique et à la dérivation de la bonne réponse.

La méthode « Chaîne de pensée » (CoT) est conçue pour évaluer les modèles de langage à grande échelle sur les évaluations de performances liées aux mathématiques, elle implique de demander aux modèles d’expliquer leur processus de raisonnement étape par étape lors de la résolution d’un problème. Il y a plusieurs avantages à cela. Cela rend le processus de raisonnement plus transparent, aide à identifier les défauts dans la logique du modèle et permet une évaluation plus granulaire des compétences en résolution de problèmes. En décomposant des problèmes complexes en une série de étapes plus simples, CoT peut améliorer les performances du modèle sur les évaluations de performances mathématiques et fournir des insights plus profonds sur ses capacités de raisonnement.

GSM8K : Une évaluation de performances mathématiques populaire

L’une des évaluations de performances bien connues pour évaluer les capacités mathématiques des modèles de langage à grande échelle est l’ensemble de données GSM8K. GSM8K se compose de 8 500 problèmes mathématiques de niveau collège, qui nécessitent plusieurs étapes pour être résolus, et les solutions impliquent principalement l’exécution d’une séquence de calculs élémentaires. Généralement, les plus grands modèles ou ceux spécifiquement formés pour le raisonnement mathématique tendent à performer mieux sur cette évaluation de performances, par exemple, les modèles GPT-4 affichent un score de 96,5 %, tandis que DeepSeekMATH-RL-7B est légèrement en retard avec 88,2 %.

Bien que GSM8K soit utile pour évaluer la capacité d’un modèle à gérer des problèmes mathématiques de niveau collège, il peut ne pas pleinement capturer la capacité du modèle à résoudre des défis mathématiques plus avancés ou diversifiés, limitant ainsi son efficacité comme mesure globale des capacités mathématiques.

L’ensemble de données mathématiques : Une alternative complète

L’ensemble de données mathématiques a remédié aux lacunes des évaluations de performances comme GSM8K. Cet ensemble de données est plus vaste, allant de l’arithmétique élémentaire aux problèmes de niveau lycée et même universitaire. Il est également comparé aux performances humaines, avec un étudiant en sciences informatiques qui n’aime pas les mathématiques atteignant une précision de 40 % et un médaillé d’or atteignant une précision de 90 %.

Il fournit une évaluation plus complète des capacités mathématiques d’un modèle de langage à grande échelle. Il s’assure que le modèle est compétent dans l’arithmétique de base et compétent dans des domaines complexes tels que l’algèbre, la géométrie et le calcul. Mais la complexité accrue et la diversité des problèmes peuvent rendre difficile pour les modèles d’atteindre une grande précision, en particulier ceux qui ne sont pas explicitement formés sur une large gamme de concepts mathématiques. De plus, les formats de problèmes variés dans l’ensemble de données mathématiques peuvent introduire des incohérences dans les performances du modèle, ce qui rend plus difficile de tirer des conclusions définitives sur la compétence mathématique globale du modèle.

Utiliser la méthode « Chaîne de pensée » avec l’ensemble de données mathématiques peut améliorer l’évaluation car elle révèle les capacités de raisonnement étape par étape des modèles de langage à grande échelle sur un large éventail de défis mathématiques. Une approche combinée comme celle-ci garantit une évaluation plus robuste et plus détaillée des véritables capacités mathématiques d’un modèle de langage à grande échelle.

Évaluations de compréhension de la lecture

Une évaluation de compréhension de la lecture évalue la capacité du modèle à comprendre et à traiter du texte complexe, ce qui est particulièrement fondamental pour des applications telles que le support client, la génération de contenu et la récupération d’informations. Il existe plusieurs évaluations de performances conçues pour évaluer cette compétence, chacune avec des caractéristiques uniques qui contribuent à une évaluation complète des capacités du modèle.

RACE (Évaluation de la compréhension de la lecture à partir d’examens)

Les évaluations de performances RACE ont près de 28 000 passages et 100 000 questions collectées à partir d’examens en anglais pour les étudiants chinois de niveau collège entre 12 et 18 ans. Il ne restreint pas les questions et les réponses à être extraites des passages donnés, ce qui rend les tâches encore plus difficiles.

Il couvre un large éventail de sujets et de types de questions, ce qui permet une évaluation complète et inclut des questions à différents niveaux de difficulté. De plus, les questions dans RACE sont spécifiquement conçues pour tester les compétences de lecture humaines et sont créées par des experts dans le domaine.

Cependant, l’évaluation de performances a quelques inconvénients. Puisqu’elle est développée à partir de matériel éducatif chinois, elle est susceptible d’introduire des biais culturels qui ne reflètent pas un contexte global. De plus, le niveau de difficulté élevé de certaines questions n’est pas représentatif des tâches typiques du monde réel. Les évaluations de performances peuvent donc ne pas être très précises.

DROP (Raisonnement discret sur des paragraphes)

Une autre approche significative est DROP (Raisonnement discret sur des paragraphes), qui défie les modèles à effectuer un raisonnement discret sur des paragraphes. Il comporte 96 000 questions pour tester les capacités de raisonnement des modèles de langage à grande échelle et les questions sont extraites de Wikipedia et créées par la foule sur Amazon Mechanical Turk. Les questions DROP exigent souvent que les modèles effectuent des opérations mathématiques comme l’addition, la soustraction et la comparaison sur la base d’informations dispersées dans un passage.

Les questions sont difficiles. Ils exigent que les modèles de langage à grande échelle localisent plusieurs nombres dans le passage et les additionnent ou les soustraient pour obtenir la réponse finale. Les grands modèles tels que GPT-4 et Palm atteignent respectivement 80 % et 85 %, tandis que les humains atteignent 96 % sur l’ensemble de données DROP.

Évaluations de bon sens

Tester le bon sens dans les modèles de langage est intéressant mais également crucial car il évalue la capacité du modèle à porter des jugements et à faire des inférences qui s’alignent sur la raison humaine. Contrairement à nous, qui développons un modèle de monde complet à travers des expériences pratiques, les modèles de langage sont formés sur des ensembles de données énormes sans vraiment comprendre le contexte. Cela signifie que les modèles luttent contre les tâches qui nécessitent une compréhension intuitive des situations quotidiennes, un raisonnement logique et des connaissances pratiques, qui sont très importantes pour des applications d’IA robustes et fiables.

HellaSwag (Fins plus difficiles, contextes plus longs et activités à faible tir pour des générations adverses)

Hellaswag a été développé par Rowan Zellers et ses collègues à l’Université de Washington et à l’Institut Allen pour l’intelligence artificielle. Il est conçu pour tester la capacité d’un modèle à prédire la continuation la plus plausible d’un scénario donné. Cette évaluation de performances est construite à l’aide d’un filtrage adversatif (AF), où une série de discriminateurs sélectionne de manière itérative des réponses incorrectes générées par machine. Cette méthode crée un ensemble de données avec des exemples triviaux pour les humains mais difficiles pour les modèles, aboutissant à une « zone d’or » de difficulté.

Bien que Hellaswag ait été difficile pour les modèles précédents, les modèles d’état de l’art comme GPT-4 ont atteint des niveaux de performance proches de l’exactitude humaine, indiquant des progrès importants dans le domaine. Cependant, ces résultats soulignent la nécessité de continuer à évoluer les évaluations de performances pour suivre les progrès des capacités de l’IA.

Openbook

L’ensemble de données Openbook se compose de 5 957 questions à choix multiple de niveau élémentaire en sciences. Les questions sont collectées à partir d’examens ouverts et sont conçues pour évaluer la compréhension humaine du sujet.

L’évaluation de performances Openbook nécessite des capacités de raisonnement au-delà de la récupération d’informations. GPT-4 atteint la précision la plus élevée à ce jour, à 95,9 %.

OpenbookQA est modelé d’après des examens ouverts et se compose de 5 957 questions à choix multiple de niveau élémentaire en sciences. Ces questions sont conçues pour sonder la compréhension de 1 326 faits scientifiques de base et leur application à des situations nouvelles.

De même que Hellaswag, les modèles précédents ont trouvé OpenbookQA difficile, mais les modèles modernes comme GPT-4 ont atteint des niveaux de performance proches de ceux des humains. Ce progrès met en évidence l’importance de développer des évaluations de performances encore plus complexes et nuancées pour continuer à pousser les limites de la compréhension de l’IA.

Les évaluations de performances suffisent-elles pour l’évaluation des performances des modèles de langage à grande échelle ?

Oui, bien qu’elles offrent une approche standardisée pour évaluer les performances des modèles de langage à grande échelle, elles peuvent également être trompeuses. L’organisation des systèmes de modèles à grande échelle indique qu’une bonne évaluation de performances pour les modèles de langage à grande échelle devrait être évolutives, capable d’évaluer de nouveaux modèles avec un nombre relativement faible d’essais, et fournir un ordre de classement unique pour tous les modèles. Mais il y a des raisons pour lesquelles elles peuvent ne pas être suffisantes. Voici quelques-unes :

Fuite d’évaluation de performances

C’est une rencontre courante, et cela se produit lorsque les données de formation se chevauchent avec les données de test, ce qui conduit à une évaluation trompeuse. Si un modèle a déjà rencontré certaines questions de test pendant la formation, son résultat peut ne pas refléter avec précision ses véritables capacités. Mais une évaluation de performances idéale devrait minimiser la mémorisation et refléter les scénarios du monde réel.

Biais d’évaluation

Les classements des évaluations de performances pour les modèles de langage à grande échelle sont utilisés pour comparer les performances des modèles sur diverses tâches. Cependant, s’appuyer sur ces classements pour comparer les modèles peut être trompeur. De simples changements dans les tests d’évaluation de performances, tels que la modification de l’ordre des questions, peuvent déplacer le classement des modèles de jusqu’à huit positions. De plus, les modèles de langage à grande échelle peuvent performer différemment en fonction des méthodes de notation, soulignant l’importance de considérer les biais d’évaluation.

Ouverture

Les interactions du monde réel avec les modèles de langage à grande échelle impliquent la conception de invites pour générer les sorties d’IA souhaitées. Les sorties des modèles de langage à grande échelle dépendent de l’efficacité des invites, et les évaluations de performances sont conçues pour tester la conscience du contexte des modèles de langage à grande échelle. Bien que les évaluations de performances soient conçues pour tester la conscience du contexte, elles ne se traduisent pas toujours directement en performances du monde réel. Par exemple, un modèle qui atteint un score de 100 % sur un ensemble de données d’évaluation de performances, tel que le LSAT, ne garantit pas le même niveau de précision dans des applications pratiques. Cela souligne l’importance de considérer la nature ouverte des tâches du monde réel dans l’évaluation des modèles de langage à grande échelle.

Évaluation efficace pour des modèles de langage à grande échelle robustes

Donc, maintenant vous savez que les évaluations de performances ne sont pas toujours la meilleure option car elles ne peuvent pas toujours généraliser à tous les problèmes. Mais il y a d’autres moyens.

Évaluations de performances personnalisées

Ceux-ci sont parfaits pour tester des comportements et des fonctionnalités spécifiques dans des scénarios de tâches spécifiques. Disons, si un modèle de langage à grande échelle est conçu pour les officiers médicaux, les ensembles de données collectés à partir de contextes médicaux représenteront efficacement les scénarios du monde réel. Ces évaluations de performances personnalisées peuvent se concentrer sur la compréhension du langage spécifique au domaine, les performances et les exigences contextuelles uniques. En alignant les évaluations de performances sur les scénarios du monde réel possibles, vous pouvez vous assurer que le modèle de langage à grande échelle se comporte bien en général et excelle dans les tâches spécifiques pour lesquelles il est destiné. Cela peut aider à identifier et à résoudre les lacunes ou les faiblesses dans les capacités du modèle dès le départ.

Pipeline de détection de fuite de données

Si vous voulez que vos évaluations « montrent » l’intégrité, avoir un pipeline d’évaluation de performances sans fuite de données est très important. La fuite de données se produit lorsque les données d’évaluation de performances sont incluses dans le corpus de préformation du modèle, ce qui entraîne des scores de performance artificiellement élevés. Pour éviter cela, les évaluations de performances doivent être croisées avec les données de préformation. De plus, des étapes doivent être prises pour éviter toute information précédemment vue. Cela peut impliquer l’utilisation d’ensembles de données propriétaires ou nouvellement créés qui sont maintenus séparément du pipeline de formation du modèle – cela garantira que les métriques de performance que vous obtenez reflètent la capacité du modèle à généraliser bien.

Évaluation humaine

Les métriques automatisées seules ne peuvent pas capturer la pleine gamme des performances d’un modèle, en particulier lorsqu’il s’agit d’aspects nuancés et subjectifs de la compréhension et de la génération du langage. Ici, l’évaluation humaine fournit une évaluation beaucoup plus précise :

  • Embaucher des professionnels qui peuvent fournir des évaluations détaillées et fiables, en particulier pour des domaines spécialisés.
  • Externalisation ! Les plateformes comme Amazon Mechanical Turk vous permettent de recueillir rapidement et à faible coût des jugements humains diversifiés.
  • Retour d’expérience de la communauté : Utiliser des plateformes comme le LMSYS leaderboard arena, où les utilisateurs peuvent voter et comparer des modèles, ajoute une couche supplémentaire d’insight. Le LMSYS Chatbot Arena Hard, par exemple, est particulièrement efficace pour mettre en évidence les différences subtiles entre les meilleurs modèles grâce à des interactions utilisateur directes et à des votes.

Conclusion

Sans évaluation et évaluation de performances, nous n’aurions aucun moyen de savoir si la capacité des modèles de langage à grande échelle à gérer les tâches du monde réel est aussi précise et applicable que nous le pensons. Mais, comme je l’ai dit, les évaluations de performances ne sont pas une façon complètement infaillible de vérifier cela, elles peuvent conduire à des lacunes dans les performances des modèles de langage à grande échelle. Cela peut également ralentir le développement de modèles de langage à grande échelle qui sont vraiment robustes pour le travail.

C’est ainsi que cela devrait être dans un monde idéal. Les modèles de langage à grande échelle comprennent les requêtes utilisateur, identifient les erreurs dans les invites, complètent les tâches comme indiqué et génèrent des sorties fiables. Les résultats sont déjà grands mais pas idéaux. C’est là que les évaluations de performances spécifiques à la tâche sont très utiles, tout comme l’évaluation humaine et la détection de fuite d’évaluation de performances. En utilisant ceux-ci, nous avons la chance de produire des modèles de langage à grande échelle vraiment robustes.

Irina Barskaya, PhD, est une scientifique de données distinguée avec plus d'une décennie d'expérience, englobant à la fois l'analyse de produits et l'analyse de technologies de pointe. Elle a dirigé la création et l'analyse de Yasmina, la première assistante vocale basée sur l'IA entièrement fonctionnelle et localisée pour l'Arabie saoudite, gérant la localisation de données complexes et l'étiquetage pour l'arabe standard moderne et les dialectes saoudiens. Actuellement, Irina dirige l'analyse de la qualité chez Yandex, impulsant les progrès des technologies de l'IA.