NextRaise Logo
NextRaise
JobsDiscover rolesJob TrackerTrack applied positionsMy ResumesBuild & optimize resumes
Tools
Job Match AnalyzerPaste JD, get fit scoreATS ScoreScan for ATS issues
Chrome Extension
ResumesJobsProfile
Jobs / Monitoring & Evaluation Specialist in Canada
1 day agoBe an early applicant
Appnovation·1 day ago
1 day agoBe an early applicant

AI Evaluation Engineer (QA)

Montreal, CanadaFull-timeMid · 4+ years

Sign up free to see how well your resume matches this role.

About this role

About us

Appnovation is a global, full-service digital partner that combines Strategy, Experience & Design, Engineering and Managed Services. We build digital solutions that deliver real impact today and serve as foundations for future growth.  Bold ambition. Practical action. Endless possibilities.

ENGLISH WILL FOLLOW 

La technologie est au cœur de toutes les offres d'Appnovation, du conseil à l'innovation numérique, en passant par la création de produits et services digitaux. Le département technologie se concentre sur la livraison de solutions logicielles qui permettent des expériences riches pour les utilisateurs, des applications mobiles et web à l'analytique avancée et l'apprentissage automatique, en passant par les plateformes de gestion de contenu et d'engagement.

Nos capacités technologiques reposent sur une expertise approfondie du cycle de vie du développement logiciel, une créativité constante, une passion pour le métier et une collaboration étroite avec les autres disciplines — des ingrédients essentiels à la réussite des expériences numériques et des partenariats clients.

En tant qu'ingénieur QA / Évaluation IA, vous rejoindrez une équipe dynamique et expérimentée dans un rôle tourné vers l'avenir, dont la mission est de démontrer concrètement que la plateforme améliore la qualité des réponses. Vous exécuterez des évaluations à grande échelle — de petits lots UAT humains jusqu'à des millions d'évaluations automatisées — mesurerez statistiquement l'ancrage factuel et les gains de précision, et construirez le cadre de métriques permettant de montrer l'amélioration de la qualité des réponses dans le temps.

RESPONSABILITÉS PRINCIPALES

  • ExĂ©cuter des Ă©valuations Ă  grande Ă©chelle sur de larges ensembles de questions, des petits lots UAT humains jusqu'Ă  des centaines de milliers ou millions d'Ă©valuations automatisĂ©es.
  • Mesurer statistiquement l'ancrage factuel et les gains de prĂ©cision (avant/après), au-delĂ  des simples tests A/B humains.
  • Construire un cadre de mĂ©triques illustrant l'amĂ©lioration de la qualitĂ© (ex. : « la rĂ©ponse est soutenue Ă  X% par le contenu source / Y% meilleure »).
  • Concevoir des tests de charge et de qualitĂ© Ă  mesure que le corpus Ă©volue.
  • DĂ©finir et maintenir les plans de test, cas de test et critères de qualitĂ©.
  • Automatiser les suites de rĂ©gression et d'Ă©valuation et les intĂ©grer dans les pipelines CI/CD.
  • Communiquer clairement les mĂ©triques de qualitĂ© aux parties prenantes techniques et non techniques.
  • Collaborer avec l'ingĂ©nierie pour reproduire, trier et vĂ©rifier les correctifs.
  • AmĂ©liorer continuellement les processus et la couverture QA.

QUALIFICATIONS

  • BaccalaurĂ©at dans un domaine technique ou expĂ©rience Ă©quivalente.
  • 4 ans et plus en QA / ingĂ©nierie de test, avec une exposition aux systèmes de donnĂ©es et d'apprentissage automatique.
  • MaĂ®trise de Python et des techniques de science des donnĂ©es pour mesurer l'ancrage factuel et la qualitĂ© des rĂ©ponses.
  • ExpĂ©rience avec les cadres d'Ă©valuation de LLM et l'analyse statistique.
  • CapacitĂ© Ă  construire des harnais d'Ă©valuation automatisĂ©s Ă  grande Ă©chelle ainsi que des tests A/B humains plus lĂ©gers.
  • Aisance Ă  travailler avec les sorties de plusieurs fournisseurs de LLM.
  • MaĂ®trise des cadres d'automatisation de tests et des scripts.
  • Souci du dĂ©tail, avec de solides compĂ©tences analytiques et de communication.

QUI VOUS ĂŠTES

  • Vous pensez Ă  comment automatiser et opĂ©rer Ă  grande Ă©chelle, pas seulement Ă  rĂ©soudre le problème immĂ©diat.
  • Vous comprenez la pensĂ©e lean.
  • Vous Ă©tablissez des standards Ă©levĂ©s en matière de qualitĂ© de code, de performance et de sĂ©curitĂ©, et recherchez l'amĂ©lioration continue.
  • Vous avez de solides compĂ©tences analytiques, en rĂ©solution de problèmes et en prise de dĂ©cision.
  • Vous adoptez une approche centrĂ©e sur le client avec un vrai sens du service.
  • Vous dĂ©veloppez des relations positives avec les parties prenantes internes et externes, tout en gĂ©rant plusieurs initiatives aux prioritĂ©s parfois concurrentes.
  • Vous faites preuve d'initiative, de passion et de fortes compĂ©tences en communication et en collaboration dans un environnement transversal.
  • Vous ĂŞtes rĂ©actif et vous Ă©panouissez dans un environnement rapide, diversifiĂ© et en constante Ă©volution.
  • Vous recherchez activement de nouveaux dĂ©fis et apprenez rapidement de nouveaux concepts, modèles d'affaires et technologies.
  • Vous avez une expĂ©rience prĂ©alable en consultation.
  • Une expĂ©rience et des connections dans l'industrie des sciences de la vie sont un atout.

 

Technology is foundational to all of Appnovation’s offerings, from consulting to digital innovation, to digital product and service creation. The technology department is focused on delivering software solutions that enable rich consumer experiences, from mobile and web applications to advanced analytics and machine learning, to content and engagement management service enablement platforms.

Inherent throughout our tech capabilities is deep expertise in the Software Development Life Cycle, a drive for creativity, a passion for the craft, and collaboration with other disciplines - all foundational ingredients in successful digital experiences and client partnerships.

As a QA / AI Evaluation Engineer, you will join a highly motivated and experienced team in a forward-leaning role that proves the platform actually improves answer quality. You will run evaluations at scale — from small human-UAT batches up to millions of automated evals — statistically measure factual grounding and accuracy lift, and build the metrics framework that shows how much better our answers get over time. We are looking for people who can bring a strong, solution-focused mindset and contribute to quality standards, best practices and get things done.

KEY RESPONSIBILITIES

  • Run evals at scale across large question sets, from small human-UAT batches up to hundreds of thousands or millions of automated evaluations.
  • Statistically measure factual grounding and accuracy lift (before/after), not just human A/B testing.
  • Build a metrics framework showing quality improvement (e.g., “answer is X% supported by source content / Y% better”).
  • Design load and quality tests as the corpus scales.
  • Define and maintain test plans, test cases, and quality gates.
  • Automate regression and evaluation suites; integrate them into CI/CD.
  • Report quality metrics clearly to technical and non-technical stakeholders.
  • Collaborate with engineering to reproduce, triage, and verify fixes.
  • Continuously improve QA processes and coverage.

QUALIFICATIONS

  • Bachelor’s Degree in a technical field or equivalent experience.
  • 4+ years in QA / test engineering, with exposure to data/ML systems.
  • Strong Python and data-science techniques for measuring factual grounding and answer quality.
  • Experience with LLM evaluation frameworks and statistical analysis.
  • Ability to build automated, large-scale eval harnesses plus lighter human-in-the-loop A/B tests.
  • Comfort working across multiple LLM providers’ outputs.
  • Test automation frameworks and scripting.
  • Detail-oriented, with strong analytical and communication skills.

WHO YOU ARE

  • You think about how to scale, automate and operate, not just how to build a solution to an immediate problem
  • You understand lean thinking
  • You set high standards for code quality, performance/scalability and security and seek continuous improvement
  • You have solid analytical, problem solving and decision-making skills
  • You have customer first mindset and a devotion to customer service
  • You engage and build positive internal and external client relationships, while managing multiple initiatives, often with competing priorities
  • You have strong self-initiative, passion, interpersonal, oral and written communication and collaboration skills with the ability to work, influence and make an impact in a cross-functional environment with all levels of the organization
  • You are responsive and thrive in a fast-paced diverse high-performance environment with rapidly changing business needs
  • You actively seek out things outside your comfort zone with the ability to rapidly learn and take advantage of new concepts, business models, and technologies
  • You have prior experience in consulting
  • Prior experience and connections in the Life Sciences industry is preferred
Thank you for your interest in a career with Appnovation Technologies! Please note that only those selected for an interview will be contacted.
 
At Appnovation, we recognize that diverse teams are the strongest teams. Diversity, Equity & Inclusion is not only something that we embrace - we celebrate it! We are proud to be an Equal Opportunity Employer and we encourage applicants from all backgrounds, lived experiences and industries to apply. Come join us at Appnovation, and learn more about how we stay true to our company values as we build better lives through better digital.

Accommodations are available upon request throughout the recruitment process.
H1B sponsor likely
AI tools
Apply faster with autofillThe NextRaise extension autofills your application in one click.Get the extension

Similar jobs

  • AI Evaluation Engineer (QA) at appnovationSĂŁo Paulo, Canada
  • AI Evaluation Engineer (QA) at appnovationToronto, Canada
  • AI Evaluation Engineer (Python, QA or Security) at toloka-aiAlberta, Canada
  • Freelance Agent Evaluation Engineer at toloka-aiManitoba, Canada
  • Intern, AI Solutions for External Manager Selection & Monitoring (May - August 2027) at investpspMontreal, Canada
  • AI Evaluation Engineer at zafinlabsamericasincToronto, Canada