AI-mallit ja alustat

Yksinkertainen Lineaari Regressio Data Science -alalla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Data science on laaja ala, joka kasvaa joka päivä. Tänään johtavat yritykset etsivät ammattitaitoisia data tutkijoita, jotka omistavat vahvan tiedon alasta ja sen liittyvistä käsitteistä. Tällä alalla menestyäkseen on tärkeää omistaa hyvä tietämys kaikista data science -algoritmeista. Yksi perustavimmista data science -algoritmeista on yksinkertainen lineaari regressio. Jokaisen data tutkijan tulisi tietää, miten käyttää tätä algoritmia ongelmien ratkaisemiseen ja merkityksellisten tulosten saavuttamiseen.

Yksinkertainen lineaari regressio on menetelmä, jolla määritetään syöte- ja tuloste-muuttujien välinen suhde. Syöte-muuttujat ovat riippumattomia muuttujia tai ennustajia, ja tuloste-muuttujat ovat riippuvia muuttujia tai vastauksia. Yksinkertaisessa lineaarisessa regressiossa otetaan huomioon vain yksi syöte-muuttuja.

Reaaliaikainen Esimerkki Yksinkertaisesta Lineaarisesta Regressiosta

Tarkastellaan tietojoukkoa, joka koostuu kahdesta parametrissa: työtunteja ja suoritettua työtä. Yksinkertainen lineaari regressio pyrkii arvioimaan suoritettua työtä, kun työtunnit ovat annettuina. Piirretään regressiolinja, joka tuottaa minimi-virheen. Muodostetaan myös lineaarinen yhtälö, jota voidaan käyttää melkein mihin tahansa tietojoukkoon.

Periaatteet, jotka kuvaa yksinkertaisen lineaarisen regressio -tarkoituksen:

Yksinkertainen lineaari regressio käytetään ennustamaan suhdetta muuttujien välillä tietojoukossa ja johtamaan merkityksellisiä johtopäätöksiä. Yksinkertainen lineaari regressio käytetään pääasiassa johdattamaan tilastollista suhdetta muuttujien välillä, joka ei ole tarpeeksi tarkin. Neljä perusperiaatetta kuvaa yksinkertaisen lineaarisen regressio -käytön. Nämä periaatteet on lueteltu alla:

  1. Suhde kahden muuttujan välillä on lineaarinen ja additiivinen: Jokaiselle riippuvan ja riippumattoman muuttujan parille asetetaan suora linjafunktio. Tämän linjan kulmakerroin on erilainen kuin tietojoukon arvot. Riippuvat muuttujat vaikuttavat riippumattomien muuttujien arvoihin additiivisesti.
  2. Virheet ovat tilastollisesti riippumattomia: Tämä periaate voidaan soveltaa tietojoukkoon, joka sisältää tietoa ajan ja sarjan suhteen. Tällaisen tietojoukon peräkkäiset virheet eivät korreloi ja ovat tilastollisesti riippumattomia.
  3. Virheillä on vakio varianssi (homoskedastisuus): Virheiden homoskedastisuutta voidaan tarkastella eri parametreja, kuten aikaa, muita ennusteita ja muita muuttujia.
  4. Virheiden jakautuminen on normaalia: Tämä on tärkeä periaate, koska se tukee edellä mainittuja kolmea periaatetta. Jos suhdetta muuttujien välillä tietojoukossa ei voida määrittää tai jos yksikin edellä mainituista periaatteista ei toteudu, kaikki mallin tuottamat ennusteet ja johtopäätökset ovat väärin. Nämä johtopäätökset eivät voida käyttää edelleen projektissa, koska niistä ei saada oikein tuloksia, jos väärää ja harhaanjohtavaa tietoa käytetään.

Yksinkertaisen Lineaarisessa Regressio -menetelmän Edut

  • Tämä menetelmä on erittäin helppo käyttää, ja tulokset saadaan helposti.
  • Tämä menetelmä on huomattavasti vähemmän monimutkainen kuin muut data science -algoritmit, erityisesti jos suhde riippuvien ja riippumattomien muuttujien välillä on tiedossa.
  • Yli-sovittaminen on yleinen ongelma, joka ilmenee, kun tämä menetelmä ottaa merkityksettömän tiedon. Tätä ongelmaa voidaan käsitellä sääntöistämismenetelmällä, joka vähentää yli-sovittamisen ongelmaa vähentämällä monimutkaisuutta.

Yksinkertaisen Lineaarisessa Regressio -menetelmän Haitat

  • Vaikka yli-sovittamisen ongelmaa voidaan vähentää, sitä ei voida täysin ignoroida. Menetelmä voi ottaa huomioon merkityksettömän tiedon ja poistaa myös merkityksellisen tiedon. Tällaisessa tapauksessa kaikki ennusteet ja johtopäätökset tietyn tietojoukon suhteen ovat väärin ja eivät tuota toivottuja tuloksia.
  • Virheellisten arvojen ongelma on myös hyvin yleinen. Virheelliset arvot ovat väärin arvoja, jotka eivät vastaa tietojoukon oikeaa arvoa. Kun tällaisia arvoja otetaan huomioon, koko malli tuottaa harhaanjohtavia tuloksia, joita ei voida käyttää.
  • Yksinkertaisessa lineaarisessa regressiossa oletetaan, että tietojoukossa on riippumattomia arvoja. Tämä oletus on väärä, koska muuttujien välillä voi olla jonkinlaista riippuvuutta.

Yksinkertainen lineaari regressio on hyödyllinen tekniikka määrittämään syöte- ja tuloste-muuttujien suhdetta tietojoukossa. Yksinkertaisella lineaarisella regressiolla on useita käytännön sovelluksia. Tämä algoritmi ei vaadi suurta laskentakapasiteettia ja voidaan helposti toteuttaa. Saadut yhtälöt ja johtopäätökset voidaan kehittää edelleen ja ne ovat erittäin helppoja ymmärtää. Kuitenkin jotkut ammattilaiset ovat sitä mieltä, että yksinkertainen lineaari regressio ei ole oikea menetelmä moniin sovelluksiin, koska siinä tehdään paljon oletuksia. Nämä oletukset voivat osoittautua vääriksi. Siksi on tärkeää käyttää tätä tekniikkaa vain siellä, missä se voidaan soveltaa oikein.

Data Scientist -henkilöstöllä yli 8 vuoden ammatti kokemus IT-alalla. Päättäväinen Data Science ja Digital Marketing. Asiantuntemus ammattitutkimuksella tuotetussa teknisessä sisällössä.