Lead data annotation projects: manage the end-to-end execution of multiple projects, ensuring performance targets and SLAs are met.
Serve as the primary stakeholder interface for key internal requestors: translate product or business needs into clear labeling project requirements, align on targets, support workforce management planning, and develop delivery plans.
Drive delivery governance and cross-functional collaboration: establish operating rhythms, execution reviews, and escalation frameworks across QA, vendor, and business teams.
...
Drive strategic initiatives that improve the effectiveness, scalability, and long-term direction of AI-related operations within Trust & Safety.
Partner with cross-functional teams including product, operations, policy, data, and engineering to identify key business challenges, define priorities, and drive execution against strategic goals.
Analyze operational performance, emerging risks, and industry trends to identify opportunities for process improvement, capability building, and organizational optimization.
...
Exposure to or practical experience in AI, large language models (LLM), or related cutting-edge technology fields; candidates who can connect AI technology to business direction are preferred.
Build and evolve the agent runtime (harness / agent loop) powering our customer-service agents — orchestrate skills, tools, and context; implement loop control & intervention, progressive disclosure, and behavior-level guardrails.
Engineer context & memory for long multi-turn agents — agentic memory (structured note-taking), context compaction / summarization, context editing / observation masking, and just-in-time (retrieve-then-load) retrieval.
Post-train and fine-tune LLMs (SFT / DPO / RL) and build the data flywheel that turns served conversations into training / eval / retrieval signals.
...
Build and evolve the agent runtime (harness / agent loop) powering our customer-service agents — orchestrate skills, tools, and context; implement loop control & intervention, progressive disclosure, and behavior-level guardrails.
Engineer context & memory for long multi-turn agents — agentic memory (structured note-taking), context compaction / summarization, context editing / observation masking, and just-in-time (retrieve-then-load) retrieval.
Post-train and fine-tune LLMs (SFT / DPO / RL) and build the data flywheel that turns served conversations into training / eval / retrieval signals.
...
Build and evolve the agent runtime (harness / agent loop) powering our customer-service agents — orchestrate skills, tools, and context; implement loop control & intervention, progressive disclosure, and behavior-level guardrails.
Engineer context & memory for long multi-turn agents — agentic memory (structured note-taking), context compaction / summarization, context editing / observation masking, and just-in-time (retrieve-then-load) retrieval.
Post-train and fine-tune LLMs (SFT / DPO / RL) and build the data flywheel that turns served conversations into training / eval / retrieval signals.
...
Drive core technology development for large language model code direction, continuously optimizing code comprehension, reasoning, and generation capabilities.
Focus on improving code comprehension, reasoning, and generation capabilities in real-world production codebases, improving TikTok service code performance and privacy compliance.
Explore Code Agent capabilities suitable for actual business production environments, and improve TikTok R&D efficiency.
...
Drive core technology development for large language model code direction, continuously optimizing code comprehension, reasoning, and generation capabilities.
Focus on improving code comprehension, reasoning, and generation capabilities in real-world production codebases, improving TikTok service code performance and privacy compliance.
Explore Code Agent capabilities suitable for actual business production environments, and improve TikTok R&D efficiency.
...
Build and evolve the agent runtime (harness / agent loop) powering our customer-service agents — orchestrate skills, tools, and context; implement loop control & intervention, progressive disclosure, and behavior-level guardrails.
Engineer context & memory for long multi-turn agents — agentic memory (structured note-taking), context compaction / summarization, context editing / observation masking, and just-in-time (retrieve-then-load) retrieval.
Post-train and fine-tune LLMs (SFT / DPO / RL) and build the data flywheel that turns served conversations into training / eval / retrieval signals.
...
Participate in defining and continuously improving data quality standards, judgment rules, and acceptance criteria for large model training and evaluation scenarios.
Review data outputs against quality standards, identify issues, drive correction loops, and ensure accuracy and consistency.
Assess complex, ambiguous, and boundary cases, and turn decisions into reusable judgment rules and knowledge assets.
...
Participate in defining and continuously improving data quality standards, judgment rules, and acceptance criteria for large model training and evaluation scenarios.
Review data outputs against quality standards, identify issues, drive correction loops, and ensure accuracy and consistency.
Assess complex, ambiguous, and boundary cases, and turn decisions into reusable judgment rules and knowledge assets.
...
Participate in defining and continuously improving data quality standards, judgment rules, and acceptance criteria for large model training and evaluation scenarios.
Review data outputs against quality standards, identify issues, drive correction loops, and ensure accuracy and consistency.
Assess complex, ambiguous, and boundary cases, and turn decisions into reusable judgment rules and knowledge assets.
...
Participate in defining and continuously improving data quality standards, judgment rules, and acceptance criteria for large model training and evaluation scenarios.
Review data outputs against quality standards, identify issues, drive correction loops, and ensure accuracy and consistency.
Assess complex, ambiguous, and boundary cases, and turn decisions into reusable judgment rules and knowledge assets.
...
Prompt Engineering: Design and deploy advanced prompting strategies, including Chain-of-Thought (CoT), Meta-Prompting, and Least-to-Most Prompting, to precisely guide model behavior.
AI Tool Integration: Maintain and leverage automated Root Cause Analysis (Auto-RCA) tools and automated Prompt Agents to quickly identify the causes of model failures and generate potential solutions within minutes.
Logic Diagnosis: Conduct deep-dive analysis into model hallucinations and classification errors. You will identify whether failures are caused by tokenization issues, logical gaps, or variance driven by temperature settings.
...
Participate in the development of TikTok’s search results page and other related core scenarios, working closely with Product, Design, Algorithm, and other cross-functional teams to independently drive the full cycle from requirement analysis and technical solution design to development, launch, and post-launch evaluation.
Leverage multi-platform technology stacks including Lynx, Android, iOS, and Server to develop and continuously optimize search business modules, ensuring code quality, performance, and stability.
Evaluate product performance through A/B testing and data analysis, identify experience issues, and drive feature iterations to continuously improve the user search experience.
...