Member of Technical Staff – Foundation Models & AI Systems OpenAI
Drive post-training and API model research for frontier foundation models across reasoning, coding, instruction following, and structured and tool-based generation. Contributed to Structured Outputs, o3-mini training and post-training, and GPT-4.1 research.
Architected evaluation infrastructure processing more than 100K benchmark samples and millions of generated tokens. Built Python tooling for experiment orchestration, benchmark execution, result aggregation, regression analysis, and failure analysis, reducing validation cycles by about 50% and manual evaluation effort by about 40%.