Perform comprehensive regression analysis and predictive modeling using linear regression, decision trees, and random forests. Use when you need to predict continuous values like housing prices, sales forecasts, demand predictions, or any numerical target variables. Includes automated feature engineering, model comparison, and visualization with Chinese language support.
一个用于回归分析和预测建模的综合性Claude Code技能,支持多种算法和自动化机器学习流程。
pip install -r requirements.txt
from core_regression import RegressionAnalyzer
from model_evaluation import ModelEvaluator
from prediction_visualizer import PredictionVisualizer
# 1. 数据分析和模型训练
analyzer = RegressionAnalyzer()
analysis_results = analyzer.run_complete_analysis(
'data.csv',
'target_column',
create_interactions=True
)
# 2. 模型评估
evaluator = ModelEvaluator()
comparison_results = evaluator.compare_models(analysis_results['results'])
evaluation_report = evaluator.generate_evaluation_report(analysis_results['results'])
# 3. 可视化分析
visualizer = PredictionVisualizer()
visualizer.create_comprehensive_dashboard(
analysis_results['results'],
analysis_results['feature_importance']
)
# 销售预测示例
analyzer = RegressionAnalyzer()
results = analyzer.run_complete_analysis(
'sales_data.csv',
'monthly_sales',
create_time_features=True,
time_config={
'date_col': '销售日期',
'frequency': 'M'
}
)
# 房价预测示例
results = analyzer.run_complete_analysis(
'housing_data.csv',
'房价',
create_interactions=True
)
feature1,feature2,feature3,target_variable
value1,value2,value3,target_value
...
日期,产品类别,销售额,促销活动,节假日
2024-01-01,电子产品,15000,False,False
2024-01-02,电子产品,12000,False,False
...
房屋ID,面积,房间数,卫生间数,楼层,总楼层,建造年份,地铁距离,房价
1,120,3,2,15,30,2010,500,850000
...
regression-analysis-modeling/
├── SKILL.md # 技能说明文档
├── core_regression.py # 核心回归分析引擎
├── feature_engineering.py # 特征工程工具
├── model_evaluation.py # 模型评估与比较
├── prediction_visualizer.py # 预测结果可视化
├── requirements.txt # Python依赖包
├── README.md # 使用说明
├── examples/
│ ├── housing_price_example.py # 房价预测示例
│ └── sample_housing_data.csv # 房价示例数据
└── templates/
├── regression_report_template.md # 回归分析报告模板
└── model_comparison_template.md # 模型比较模板
model_results.csv: 完整模型预测结果feature_importance.csv: 特征重要性排名model_comparison.csv: 模型性能比较regression_dashboard.png: 综合分析仪表板model_comparison.png: 模型性能对比图learning_curves.png: 学习曲线分析图{model_name}_residual_analysis.png: 残差诊断图model_evaluation_report.md: 详细评估报告regression_analysis_report.md: 综合分析报告class RegressionAnalyzer:
def load_and_validate_data() # 数据加载与验证
def preprocess_data() # 数据预处理
def encode_categorical_features() # 分类特征编码
def create_interaction_features() # 交互特征生成
def train_models() # 多模型训练
def get_feature_importance() # 特征重要性分析
class FeatureEngineering:
def extract_temporal_features() # 时间特征提取
def create_polynomial_features() # 多项式特征
def create_aggregation_features() # 聚合特征
def create_ratio_features() # 比例特征
def select_features() # 特征选择
class ModelEvaluator:
def calculate_comprehensive_metrics() # 综合指标计算
def perform_residual_analysis() # 残差分析
def compare_models() # 模型比较
def analyze_learning_curves() # 学习曲线分析
def generate_evaluation_report() # 评估报告生成
class PredictionVisualizer:
def create_comprehensive_dashboard() # 综合仪表板
def create_individual_analysis_plots() # 详细分析图
def _plot_model_performance_comparison() # 性能比较图
def _plot_feature_importance() # 特征重要性图
from feature_engineering import FeatureEngineering
fe = FeatureEngineering()
# 时间特征提取
X_temporal = fe.extract_temporal_features(df, ['date_column'])
# 特征选择
X_selected, scores = fe.select_features(X, y, method='f_regression', k=10)
from model_evaluation import ModelEvaluator
evaluator = ModelEvaluator()
# 残差分析
residual_results = evaluator.perform_residual_analysis(
y_test, y_pred, "Random Forest"
)
# 学习曲线分析
learning_results = evaluator.analyze_learning_curves(
model, X, y, cv=5
)
from prediction_visualizer import PredictionVisualizer
visualizer = PredictionVisualizer()
# 综合仪表板
visualizer.create_comprehensive_dashboard(
model_results, feature_importance
)
# 详细分析图
visualizer.create_individual_analysis_plots(
model_results, output_dir='analysis_plots'
)
内存不足
# 分批处理大数据
chunk_size = 10000
for chunk in pd.read_csv('large_data.csv', chunksize=chunk_size):
# 处理每个数据块
pass
中文显示问题
plt.rcParams['font.sans-serif'] = ['SimHei', 'Microsoft YaHei']
数据编码问题
df = pd.read_csv('data.csv', encoding='utf-8-sig') # 或 'gbk'
模型过拟合
# 增加正则化
model = Ridge(alpha=10.0)
# 或使用交叉验证
model = RandomForestRegressor(max_depth=5)
# 使用更高效的数据类型
dtypes = {
'user_id': 'category',
'product_id': 'category',
'amount': 'float32'
}
df = pd.read_csv('data.csv', dtype=dtypes)
# 使用多进程
from sklearn.model_selection import cross_val_score
scores = cross_val_score(model, X, y, cv=5, n_jobs=-1)
由回归分析与预测建模系统支持 | Powered by Regression Analysis Engine
npx skills add liangdabiao/regression-analysis-modeling下载完整 Skill 目录,包含 SKILL.md 及所有相关文件
Search for places (restaurants, cafes, etc.) via Google Places API proxy on localhost.
Interact with GitHub using the `gh` CLI. Use `gh issue`, `gh pr`, `gh run`, and `gh api` for issues, PRs, CI runs, and advanced queries.
Create or update AgentSkills. Use when designing, structuring, or packaging skills with scripts, references, and assets.
Start voice calls via the OpenClaw voice-call plugin.
Notion API for creating and managing pages, databases, and blocks.
Gemini CLI for one-shot Q&A, summaries, and generation.
Category:developer