在线咨询 400-826-1668
回到顶部
ARTICLE DETAIL

资讯详情

深耕国风建站与运营引流的一线实战洞察。

3 步跑通自动机器学习:新手最省心的 AutoML 表格建模指南

3 步跑通自动机器学习:新手最省心的 AutoML 表格建模指南 3 步跑通自动机器学习新手最省心的 AutoML 表格建模指南【免费下载链接】AutoXAutoX is an efficient automl tool, which is mainly aimed at data mining tasks with tabular data.项目地址: https://gitcode.com/gh_mirrors/aut/AutoX如果你是刚接触机器学习的新手或者是一名数据工程师很可能经历过这样的场景数据清洗花了一个下午特征工程又搭进去两天模型调参全靠猜 试结果提交线上效果还是垫底。自动机器学习AutoML工具就是为了终结这种体力活而生的而本文要介绍的AutoX正是这样一款面向表格数据的高效 AutoML 工具——它把数据清洗、特征工程、模型调参、集成这几件最耗时的事全部自动化让从拿到数据到拿到预测结果变成一条命令的事。为什么说 AutoX 值得一试一页纸看懂它的本事在决定使用一个工具之前你最关心的问题无非是它能不能用、快不快、效果好么、门槛高不高。我们把这几个问题一次性说清楚。你的疑问AutoX 给出的答案上手难不难接口风格贴近 scikit-learn用过 sklearn 的人几乎零成本适应支持哪些任务二分类、多分类、回归、时序预测覆盖表格建模绝大多数场景效果靠谱吗在多个公开数据集上与 AutoGluon、H2O 对比有明显优势且有竞赛成绩背书数据复杂怎么办支持多表数据自动关联合并、文本列自动提取 NLP 特征、图片列转向量特征能干预过程吗各模块解耦特征工程、模型训练都可单独调用不满意的地方能结合你的专家经验微调再看几组公开数据集上的对比数据来自项目 README 的官方记录感受一下差距在 Santander 二分类任务上 AUC 达到 0.89196而 AutoGluon 为 0.64643在 ventilator 回归任务上 MAE 为 0.755对比方分别是 8.434 和 4.221时序预测的 Demand Forecasting 任务 SMAPE 为 13.79而对比方分别是 25.39 和 18.90。一句话总结收益你负责定义问题和解读结果AutoX 负责把脏活累活干完并且干得比多数人手动折腾更漂亮。3 分钟跑通闭环安装、读数据、出结果这一节我们用最小可用的方式走一遍完整流程核心代码只有十几行每一行都会配上白话解释。第一步装环境约 1 分钟推荐用源码方式安装能拿到最新版本git clone https://gitcode.com/gh_mirrors/aut/AutoX cd AutoX pip install -e .如果你只是想快速体验直接 pip 安装也可以但注意包更新可能存在延迟pip install automl-x第二步准备数据并初始化约 1 分钟AutoX 要求你同时给出训练集和测试集并告诉它三件事主键列id、预测目标列target、两张表的名字。请看最小示例import pandas as pd from autox import AutoX # 读取两张表train 有标签test 是待预测的 train pd.read_csv(train.csv) test pd.read_csv(test.csv) # 初始化把表名、主键、目标列告诉 AutoX autox AutoX( id[ID_code], # 主键列每行样本的唯一编号 targettarget, # 要预测的目标列 train_nametrain, # 训练集的名字 test_nametest, # 测试集的名字 pathNone, # 因为直接传了 dfs这里留空即可 dfs{train: train, test: test} # 把两张表放进字典 )逐行理解一下id[ID_code]告诉工具哪一列是编号它在拼表、合并、生成提交文件时都要用到。targettarget指定预测目标。AutoX 会自动根据该列取值的种类数判断任务是二分类、多分类还是回归你不需要手动声明任务类型。dfs{...}把 DataFrame 直接塞进来这是最灵活的方式如果想从磁盘读也可以换成path参数指向数据目录。第三步一键出结果约 1 分钟# 训练 预测一步到位返回符合提交格式的结果表 sub autox.get_submit() sub.to_csv(submission.csv, indexFalse)get_submit()内部自动完成了特征工程、特征筛选、模型训练、集成融合最后返回一张包含主键和预测值的表直接就是可以提交的格式。对于时序类数据换成get_submit_ts()即可。从数据到结果全程你只写了不到 20 行代码。上图是 AutoX 在竞赛场景下的完整处理流水线从数据预处理、自动合并、特征工程到超参优化、模型集成、部署输出每一步都有对应的模块支撑环环相扣且全部自动化。实战进阶两个贴近业务的场景跑通最小闭环只是开始接下来我们拆解两个真实场景看看 AutoX 在更复杂的业务里怎么用以及最容易踩的坑在哪里。场景一用 AutoX 打一场表格竞赛以常见的数据挖掘竞赛为例你的数据往往不是一张干净的表而是主表 若干关联表的结构。此时操作要点如下描述表关系在初始化时通过relations参数声明表之间的关联方式1-1 或 1-NAutoX 会自动做拼表特征无需你手动merge。显式声明特征类型如果某列被识别错类型比如类别数很多的 ID 列被当成数值可以在feature_type参数里手工纠正避免特征工程跑偏。关注特征重要性用autox.get_top_features()可以拿到 TopK 重要特征列表这既帮你理解模型也能反过来指导业务分析。最常踩的坑主键列和日期列没有提前排除。如果忘记把id列加入id参数AutoX 可能会把它当作数值特征参与建模产生严重的数据泄漏。务必在初始化时把主键、时间列明确交代清楚。场景二业务侧上线部署与结果解释训练出好模型只是第一步落地到业务系统才是终点。AutoX 的生态里专门有几个子模块服务这个目标autox_server面向上线部署的 AutoML 服务训练和预测流程可以分开走适合做成定时任务或接口。autox_interpreter模型可解释模块内置 LIME、SHAP、全局代理树等方案能回答模型为什么给出这个判断。autox_nlp与autox_recommend前者自动抽取文本列特征后者面向推荐场景的召回与排序业务数据里若混有文本和用户行为可直接复用。最常踩的坑直接拿全量数据做训练却不做验证划分。虽然 AutoX 内部自带交叉验证但线上场景仍建议预留一段最近时间的样本做影子验证避免过拟合到旧数据分布上。避坑 FAQ新手问得最多的 4 个问题Q1训练时间太长能提速吗可以。初始化时开启DebugTrue会只抽样 5000 行快速跑通流程先验证代码和数据没问题再关掉 Debug 跑全量。另外对超大表格可以先做列裁剪减少无用特征进入工程流程。Q2预测结果总是偏离真实值怎么处理检查两件事一是目标列是否存在极端异常值可参考autox_competition/process_data/clip_label.py的后处理逻辑对预测值做裁剪二是训练集与测试集的分布是否差异很大可借助feature_selection/adversarial_validation.py做对抗验证来提前发现。Q3表格里有一堆文本列AutoX 会处理吗会。AutoX 会自动识别长文本列并走feature_engineer/fe_nlp.py抽取 NLP 特征更精细的文本处理能力在autox_nlp模块适合对文本质量有更高要求的场景。Q4想只复用某个环节不想全自动可以吗可以这正是它的设计理念之一。比如你只想做特征工程可以直接引入autox_competition/feature_engineer/下的FeatureStat、FeatureGbdt、FeatureTargetEncoding等类单独使用每个类都是标准的fit / transform接口。更进一步这些资源帮你深入如果你读完本文已经心动了推荐按以下路径继续深入主入口代码根目录的run_autox.py展示了如何用命令行参数直接跑通训练预测落盘适合快速复制改造。特征工程全家桶autox/autox_competition/feature_engineer/下有 count、stat、shift、diff、target encoding、GBDT 特征、图像转向量、NLP 特征等几十个模块每个都有独立 README 说明是学习特征思路的宝库。特征选择与可解释autox/autox_competition/feature_selection/与autox_interpreter/分别对应挑好特征和讲清模型两大诉求。实战示例仓库demo/目录收录了汽车销量预测、Kaggle 房价、IEEE 欺诈检测、Elo 推荐等多个完整 notebook直接对着跑一遍胜过读十篇文档。最后给你一个行动建议不要只在文章里看完就关掉找一份你手头现成的表格数据比如一份销售记录或用户行为日志用本文的 20 行代码跑一遍观察输出的特征列表和预测效果。十分钟内你就会对自动机器学习到底是什么体验有切身的认识——而这份认识远比任何教程都更有说服力。【免费下载链接】AutoXAutoX is an efficient automl tool, which is mainly aimed at data mining tasks with tabular data.项目地址: https://gitcode.com/gh_mirrors/aut/AutoX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表