Modely a platformy AI
Jednoduchá lineární regrese v oblasti datové vědy
Datová věda je rozsáhlé odvětví, které roste s každým dnem. Dnes největší společnosti hledají profesionální datové vědce, kteří mají hluboké znalosti o tomto odvětví a jeho souvisejících konceptech. Aby se v tomto odvětví dařilo, je důležité mít pevné znalosti o všech algoritmech datové vědy. Jedním z nejzákladnějších algoritmů datové vědy je jednoduchá lineární regrese. Každý datový vědec by měl vědět, jak používat tento algoritmus k řešení problémů a získávání smysluplných výsledků.
Jednoduchá lineární regrese je metodou stanovení vztahu mezi vstupními a výstupními proměnnými. Vstupní proměnné se považují za nezávislé proměnné nebo prediktory, a výstupní proměnné se považují za závislé proměnné nebo odpovědi. U jednoduché lineární regrese se bere v úvahu pouze jedna vstupní proměnná.
Reálný příklad jednoduché lineární regrese
Zvažme datový soubor, který se skládá ze dvou parametrů: počtu odpracovaných hodin a množství práce vykonané. Jednoduchá lineární regrese se snaží odhadnout množství práce vykonané, pokud jsou známy odpracované hodiny. Čára regrese se nakreslí, která generuje minimální chybu. Lineární rovnice se také vytvoří, která může být použita pro téměř jakýkoli datový soubor.
Zásady, které znázorňují účel jednoduché lineární regrese:
Jednoduchá lineární regrese se používá k předpovědi vztahu mezi proměnnými v datovém souboru a získání smysluplných závěrů. Jednoduchá lineární regrese se používá hlavně k získání statistického vztahu mezi proměnnými, který není dostatečně přesný. Čtyři základní zásady znázorňují použití jednoduché lineární regrese. Tyto zásady jsou uvedeny níže:
- Vztah mezi dvěma proměnnými se považuje za lineární a aditivní: Pro každé dvojice závislých a nezávislých proměnných se stanoví přímá funkce. Sklon této přímky se liší od hodnot proměnných v datovém souboru. Závislé proměnné mají aditivní účinek na hodnoty nezávislých proměnných.
- Chyby jsou statisticky nezávislé: Tato zásada může být zvažována pro datový soubor, který obsahuje informace související s časem a řadami. Po sobě jdoucí chyby takového datového souboru nekorelují a jsou statisticky nezávislé.
- Chyby mají konstantní variaci (homoscedasticita): Homoscedasticita chyb může být zvažována na základě různých parametrů. Tyto parametry zahrnují čas, jiné předpovědi a další proměnné.
- Normálnost rozdělení chyb: Tato zásada je důležitá, protože podporuje tři výše uvedené zásady. Pokud nelze stanovit žádný vztah mezi proměnnými v datovém souboru, nebo pokud některá z výše uvedených zásad není stanovena, pak všechny předpovědi a závěry vygenerované modelem jsou nesprávné. Tyto závěry nelze použít dále v projektu, protože nebude získán žádný skutečný výsledek, pokud se použije chybná a zavádějící data.
Výhody jednoduché lineární regrese
- Tato metoda je extrémně snadná na použití a výsledky lze získat snadno.
- Tato metoda má mnohem menší složitost než ostatní algoritmy datové vědy, zejména pokud je známa souvislost mezi závislými a nezávislými proměnnými.
- Přepřetížení je běžný stav, který nastává, když tato metoda zahrnuje bezvýznamné informace. Pro řešení tohoto problému je k dispozici technika regularizace, která snižuje problém přepřetížení snížením složitosti.
Nevýhody jednoduché lineární regrese
- Přestože lze problém přepřetížení eliminovat, nelze ho ignorovat. Metoda může zahrnout bezvýznamné údaje a také eliminovat významné informace. V takovém případě budou všechny předpovědi a závěry o bestimmém datovém souboru nesprávné a nebude možné získat efektivní výsledky.
- Problém odlehlých hodnot je také velmi častý. Odlehlé hodnoty se považují za chybné hodnoty, které neodpovídají skutečným údajům. Pokud se takové hodnoty zahrnou, celý model vygeneruje zavádějící výsledky, které nejsou použitelné.
- U jednoduché lineární regrese se předpokládá, že datový soubor obsahuje nezávislé údaje. Tento předpoklad je chybný, protože mezi proměnnými může existovat nějaká závislost.
Jednoduchá lineární regrese je užitečná technika pro stanovení vztahu mezi různými vstupními a výstupními proměnnými v datovém souboru. Existuje několik reálných aplikací jednoduché lineární regrese. Tento algoritmus nevyžaduje vysoké výpočetní prostředky a lze jej snadno implementovat. Rovnice a závěry, které se odvozují, lze dále rozvíjet a jsou extrémně snadné na pochopení. Nicméně, někteří odborníci se domnívají, že jednoduchá lineární regrese není správnou metodou pro použití v různých aplikacích, protože se dělají многие předpoklady. Tyto předpoklady mohou být prokázány jako chybné. Proto je nutné použít tuto techniku tam, kde lze správně aplikovat.












