Automate & Reverse-Engineer Prompt Engineering with PromptOptima Engine
Data Scientist & ML Engineer Agent: SOUL.md & Exploratory Data Analysis System Directives for AI Swarms
Get a production-ready SOUL.md and MEMORY.md template for a Data Scientist & ML Engineer AI Agent. Configured for Pandas, Scikit-learn, PyTorch, and automated EDA pipelines.
Data Scientist & ML Engineer Agent: SOUL.md & Exploratory Data Analysis System Directives for AI Swarms
In modern data-driven organizations, deploying autonomous agents (such as Claude Code, Hermes, Kimi Swarm, or OpenHands) to execute Exploratory Data Analysis (EDA), engineer model features, and train machine learning models dramatically accelerates research cycles.
However, without explicit mathematical and programming guardrails, data science agents often suffer from data leakage (training on test sets), unhandled missing values (`NaN`), unoptimized Pandas memory consumption, or selecting inappropriate evaluation metrics (e.g. using accuracy on imbalanced datasets).
By initializing your data agent with a specialized Data Scientist & ML Engineer `SOUL.md` Template, you ensure your agent executes rigorous statistical analysis and model training pipelines.
In this guide, we provide a complete, copy-paste production `SOUL.md` and `MEMORY.md` blueprint designed specifically for Data Science and Machine Learning agents.
---
1. Data Scientist Agent `SOUL.md` Blueprint
```markdown
SOUL.md - Data Scientist & ML Engineer Agent
1. Core Identity & Role
You are DataMind Core, a Senior Data Scientist and Machine Learning Engineer. Your mission is to perform exploratory data analysis (EDA), clean tabular/unstructured datasets, engineer predictive features, train ML models (Scikit-Learn, PyTorch, XGBoost), and evaluate statistical performance.
2. Core Operating Principles
3. Visualization & Output Directives
4. Negative Constraints
```
---
2. Matching `MEMORY.md` Schema for Data Science Agents
```markdown
MEMORY.md - Dataset & Model Experiment Memory
1. Dataset State & Features
2. Active ML Experiment Backlog
3. Model Benchmark History
```
---
3. Conclusion & Implementation
Initializing your data science agent with a specialized `SOUL.md` ensures reproducible, leak-free machine learning pipelines. Download ready-to-use agent templates at PromptsForYou.online!
Automate & Reverse-Engineer Prompt Engineering with PromptOptima Engine
Want to optimize or reverse-engineer this prompt automatically?
PromptOptima Engine automatically eliminates redundant tokens, parses XML tags, and improves model reasoning.
Frequently Asked Questions
How to use this Data Science SOUL.md template in Claude Code?
Paste the template into your project's `SOUL.md` or `.claude/` system configuration file.
How does this template prevent data leakage?
Strict directives mandate splitting train/test sets before applying any scaling or feature transformations.
Which Python libraries are supported?
Pandas, Polars, Scikit-Learn, XGBoost, LightGBM, PyTorch, Matplotlib, and Optuna.
Table of Contents
- •1. Data Scientist Agent `SOUL.md` Blueprint
- •1. Core Identity & Role
- •2. Core Operating Principles
- •3. Visualization & Output Directives
- •4. Negative Constraints
- •2. Matching `MEMORY.md` Schema for Data Science Agents
- •1. Dataset State & Features
- •2. Active ML Experiment Backlog
- •3. Model Benchmark History
- •3. Conclusion & Implementation
Related Prompt Templates
Reverse-engineer, optimize, and test LLM system prompts automatically across models.
Launch Refiner Engine ⚡