26WD96920
Position Overview
As an Applied AI Developer – Agent Evaluation on the Fusion Platform Services team within Product Development and Manufacturing Solutions (PDMS), you'll be part of a team of technologists dedicated to creating cutting-edge AI and generative AI solutions that enhance developer productivity and experience. You'll work closely with AI engineers, software architects, and product engineering teams to build, deploy, and rigorously evaluate intelligent agentic systems while developing MCP (Model Context Protocol)-based tooling that integrates seamlessly with IDEs such as VS Code and Cursor.
-
Develop and orchestrate multi-agent AI systems for automated test generation, test execution, and end-to-end development workflow optimization using frameworks such as LangGraph, AutoGen, or the Anthropic Agent SDK (Claude Code).
-
Design and implement agentic workflows that coordinate multiple AI agents to autonomously drive test automation across UI, API, integration, and system levels, from test case synthesis to result evaluation, while integrating seamlessly with existing developer tools and MCP-compatible services.
-
Build evaluation frameworks and benchmark suites for agentic systems, including comparisons of AI agents against commercial or domain-specific solutions, using tools such as AgentBench and Langfuse.
-
Evaluate and optimize MCP servers and tool integrations across agentic pipelines by measuring latency, accuracy, context fidelity, and end-to-end task completion.
-
BS/MS in Computer Science, Machine Learning, or a related applied AI field.
-
Expertise in Python and ML frameworks (PyTorch, Transformers, scikit-learn).
-
Experience with Large Language Models applied to software understanding, test generation, or agentic AI systems.
-
Knowledge of AI evaluation methodologies and metrics for agentic task completion and test quality.
-
Strong foundation in statistical analysis and experimental design.
-
Experience with developer workflow and productivity measurement frameworks.
-
Background in software engineering or QA with close collaboration with development teams.
-
Familiarity with test automation frameworks (e.g., Playwright, Selenium, Pytest, Appium) and CI/CD pipelines.
-
Experience designing evaluation frameworks or benchmark suites for AI agents against commercial or domain-specific solutions.
-
Hands-on experience with MCP (Model Context Protocol), including building, evaluating, and optimizing MCP servers and tool integrations.
-
Experience using AI evaluation and observability tools such as LangSmith, Langfuse, AgentBench, RAGAS, DeepEval, or similar platforms.
-
Experience with Azure AI Foundry/ML or AWS cloud ML platforms.
En tant que Développeur IA Appliquée – Évaluation d'Agents IA au sein de l'équipe Fusion Platform Services de Product Development and Manufacturing Solutions (PDMS), vous rejoindrez une équipe de technologues dédiée à la création de solutions d'intelligence artificielle et d'IA générative de pointe visant à améliorer la productivité et l'expérience des développeurs. Vous collaborerez étroitement avec des ingénieurs IA, des architectes logiciels et des équipes de développement produit afin de concevoir, déployer et évaluer rigoureusement des systèmes d'IA agentiques, tout en développant des outils basés sur le Model Context Protocol (MCP) intégrés à des environnements tels que VS Code et Cursor.
-
Développer et orchestrer des systèmes d'IA multi-agents pour la génération automatique de tests, leur exécution et l'optimisation des workflows de développement à l'aide de frameworks tels que LangGraph, AutoGen ou l'Anthropic Agent SDK (Claude Code).
-
Concevoir et mettre en œuvre des workflows agentiques permettant à plusieurs agents IA de piloter de manière autonome l'automatisation des tests (UI, API, intégration et système), depuis la génération des cas de test jusqu'à l'évaluation des résultats, tout en assurant une intégration fluide avec les outils de développement existants et les services compatibles MCP.
-
Développer des frameworks d'évaluation et des suites de benchmarks pour les systèmes agentiques, notamment afin de comparer les performances des agents IA à des solutions commerciales ou spécialisées, à l'aide d'outils tels qu'AgentBench et Langfuse.
-
Évaluer et optimiser les serveurs MCP ainsi que les intégrations d'outils au sein des pipelines agentiques en mesurant la latence, la précision, la fidélité du contexte et le taux de réussite des tâches de bout en bout.
-
Diplôme de niveau licence ou master en informatique, apprentissage automatique ou dans un domaine connexe de l'IA appliquée.
-
Excellente maîtrise de Python et des frameworks de machine learning (PyTorch, Transformers, scikit-learn).
-
Expérience avec les grands modèles de langage (LLM) appliqués à la compréhension logicielle, à la génération de tests ou aux systèmes d'IA agentiques.
-
Connaissance des méthodologies et des métriques d'évaluation des systèmes d'IA pour mesurer la réussite des tâches agentiques et la qualité des tests.
-
Solides bases en analyse statistique et en conception d'expériences.
-
Expérience des outils et méthodologies d'amélioration de la productivité des développeurs.
-
Expérience en développement logiciel ou en assurance qualité (QA), avec une collaboration étroite avec les équipes de développement.
-
Maîtrise des frameworks d'automatisation des tests (Playwright, Selenium, Pytest, Appium) et des pipelines CI/CD.
-
Expérience dans la conception de frameworks d'évaluation ou de suites de benchmarks permettant de comparer des agents IA à des solutions commerciales ou spécialisées.
-
Expérience pratique du Model Context Protocol (MCP), notamment dans la création, l'évaluation et l'optimisation de serveurs MCP et de leurs intégrations.
-
Expérience avec des outils d'évaluation et d'observabilité de l'IA tels que LangSmith, Langfuse, AgentBench, RAGAS, DeepEval ou des plateformes similaires.
-
Expérience des plateformes cloud d'IA telles qu'Azure AI Foundry/ML ou AWS ML.
Learn More
About Autodesk
Welcome to Autodesk! Amazing things are created every day with our software – from the greenest buildings and cleanest cars to the smartest factories and biggest hit movies. We help innovators turn their ideas into reality, transforming not only how things are made, but what can be made.
We take great pride in our culture here at Autodesk – it’s at the core of everything we do. Our culture guides the way we work and treat each other, informs how we connect with customers and partners, and defines how we show up in the world.
When you’re an Autodesker, you can do meaningful work that helps build a better world designed and made for all. Ready to shape the world and your future? Join us!
Salary transparency
Salary is one part of Autodesk’s competitive compensation package. For Canada based roles, we expect a starting base salary between $99,000 and $145,200. Offers are based on the candidate’s experience and geographic location, and may exceed this range. In addition to base salaries, our compensation package may include annual cash bonuses, commissions for sales roles, stock grants, and a comprehensive benefits package.
Belonging
We take pride in cultivating a culture of belonging where everyone can thrive. Learn more here: https://www.autodesk.com/company/global-belonging
Are you an existing contractor or consultant with Autodesk?
Please search for open jobs and apply internally (not on this external site).