Ho Quoc Tuan Same but different. Viên thích PowerBI hơn. Nó more integrated with Office suite. Nó có vài điểm mạnh mà Tableau không có:
1. Free desktop version. Student can use it free.
2. Xài Power Query and DAX which are both easier to learn and manipulate than Tableau which use base Javascript code.
3. Integrated with SharePoint which almost all companies use.
---------------------------------------
Sáng có bạn có câu hỏi rất hay!
Em thấy hiện tại các tài liệu hay khoá học về data analysis hay BI, theo như giới thiệu, phần lớn dạy về kỹ năng/kỹ thuật code, thao tác trên các tool BI để tạo ra báo cáo trực quan.
Nhưng cách tư duy như thế nào để biết mình cần phải làm báo cáo về cái gì, báo cáo như thế nào, phân tích cái gì trong đó để ra được những kết luận sắc bén và đỉnh cao, nhìn được những cái mà analyst khác không nhìn được thì các tài liệu này ít nói
--------------------------------
Mình xin trả lời từ trải nghiệm nhé:
0. Thế nào là: Sắc bén đỉnh cao:
- Bạn định nghĩa hộ mình nhé??
- Vì với ông TỔNG CEO học hêt lớp 4 thì ông ý ko chịu đeo khẩu trang <-- như thế là SẮC BÉN, ĐỈNH
- Còn với bạn học sinh hiết tiền, thì bạn ý biết đeo khẩu trang đi lấy gạo phát chẩn <--- đối với mình thế là SẮC BÉN.
.
.
.
.
1 Về vấn đề: cách tư duy như thế nào để biết mình cần phải làm báo cáo về cái gì
- Tư duy thống kê định lượng -> cho báo cáo về predictive -> vậy cần học hiểu thế nào là coef, fitness, r square
- Tư duy phân bổ dịch chuyển số lượng lớn -> cho việc dự đoán theo phân bổ các yêu tố không liên quan ---> vậy cần học logistic regression
- Tư duy dùng tính toán máy tính tính lại, tối ưu ram -> cho việc dự đoán bit data tương tự -> vậy cần học cách tạo mạng trí tuệ
- Tư duy lựa chọn thuật toán nào cho đúng -> cho việc có data mà không biết làm gì -> vậy cần học cơ bản loại data nào thì thuật toán nào là phù hợp
- Tư duy đã có thuật toán rồi, nhưng bị sai quá, đúng quá -> cho việc điều chỉnh thông số thuật toán -> càng phải học rõ hơn thuật toán đó nói cái gì, và chỉnh lại hoặc lấy lại data xem lại data có thể nó ko phù hợp
- Tuy duy phân tích cái gì trong đó -> cho việc không biết thuật toán cần cái gì đầu vào và đầu ra -> càng phải học rõ hơn thuật toán nó nói cái gì.
- Tư duy mong muốn yếu tố fit bao nhiêu % là vừa -> cho tư duy phản biện báo cáo mình làm ra -> vậy cần mua những báo cáo các tổ chức khác để so sánh với báo cáo mình
- Tư duy có kết quả rồi, nói sao để tụi KINH DOANH nó lọt tai -> cho tư duy phản biện báo cáo mình làm ra -> vậy cần học cách ăn nói cho dễ nghe. Học cách ăn nói trình bày cho bên đối diện họ phải lòi tiền ra: Xem tìm đọc các vở kịch của Shakespeare, sách của JJ.Roussou.
Có quyển sách rất hay về: Hướng dẫn các nhà kinh tế dùng thuật toán gì để dự đoán cái gì, vẽ vời cái gì cho phù hợp với data của mình. Bạn donate vào dathoc.net (dathoc.net/donation). Mình gửi cho.
-------------------------------
Giờ làm Data Mining có mấy cái tool trực quan ghê, kéo thả, xong nối nối cái ra Info mà không cần phải code chi cực thân
:)))) thậm chí làm Machine Learning mì ăn liền luôn, kéo thả vô cái rồi split data training rồi tạo Model rồi đem đi Predict như thầy bói được liền luôn
:)))))
Tool Orange:
Lai Duc Trung https://www.facebook.com/laitrungminhduc Anh thử KNIME xem ;) cũng như Orange nhưng xịn hơn với handle data tốt hơn, ko crash :3
Hàng code từ Java lên mà anh :)) Với thằng KNIME nó có nhiều plugin, còn Orange thấy cho education thôi à :))
Em nghe bảo bên Yolo VPBank nó chạy KNIME ấy :))
Hong Phuc Nguyen: Lai Trung Minh Duc orange nó base trên python nên thiếu gì toàn phải code vô =))) lại về cái máng cũ :)))
Lai Trung Minh Duc: Hong Phuc Nguyen Đã lười code nên phải "đứng trên vai ng khổng lồ" anh nhỉ 😝
Knime vs Rapidminer:
https://cmotions.nl/en/knime-vs-rapidminer/
--------------
Learning Python the hard way https://hackernoon.com/learning-python-the-hard-way-t8163z8n
------------------
Huyen Chip: Mình tổng hợp một số tính năng khá tuyệt vời của Python mà mình mất một thời gian mới phát hiện ra hay mới dám dùng.
Mình tập trung vào các tính năng hữu ích cho data science và machine learning.
Tại vì GitHub có vấn đề với Jupyter notebook nên mình copy nội dung sang README. Mình vẫn giữ Jupyter notebook cho những bạn nào muốn clone về chạy trên máy.
-----------------------------------------------------------------------------------------------------------------------
Q:
Chào mọi người, trong group mình có ai học supply chain và đi theo hướng data analytics ko? Cho em hỏi trong 3 ngôn ngữ R, SQL, Python thì nên học cái nào trước hết để hỗ trợ công việc ạ? Cảm ơn mọi người.
- SQL please sao ít người học SQL vậy huhu
@Nguyễn Ngọc Duy Luân giờ bà con cứ chạy theo data science, analyst mà quên mất là phải có data trước. Kiếm ng làm sql ko ra ý anh
- Sql rồi R
Source: https://m.facebook.com/groups/870665749718859?view=permalink&id=2225031537615600
#KoolJ_QnA_AI
[Data Engineering]
Question:
Mong ad duyệt bài
Em đang là sinh viên IT cũng làm Mobile 1 thời gian dài + back-end
Hiện em muốn tìm hiểu về Data engineer, nhưng không biết bắt đầu như thế nào, em có tìm hiểu qua trên mạng thì toàn là Data scientist
Mong anh chị cho em, những cái mà em cần phải học hoặc có thể anh chị gửi giúp em khoá học cũng được ạ, em cảm ơn nhiều
TRẢ LỜI:
----------------------------------------------------------------------------------------------------------
[Data Engineering - DE cho người trái nghề]
Mình nghĩ bạn có thể join 1 hoặc hai khóa học, xong cần có những chỉ dẫn để các bạn, nhất là các bạn trái nghề hoàn thiện những kỹ năng sau.
Đây là quan điểm của cá nhân mình sau những trải nghiệm.
Các bạn khác bổ sung để có đường đi nước bước tốt hơn.
Đường hướng chung (nếu những gợi ý dưới là TA vậy bạn cần học TA rồi hãng sang DS):
1. Bạn cần làm việc và tập làm việc trên Linux/Ubuntu. Vì nó sẽ cho bạn những trải nghiệm khác với Windows, cái mà bạn mở mắt ra đã nhìn thấy. Và sẽ giúp bạn nhiều trong quá trinh học DS sau nay
(trên mạng dạy rất nhiều: Google câu lệnh thường dùng Ubuntu, CentOS là r)
2. OOP - lập trình hướng đối tượng. Học Java - ít nhất 1 tháng
3. Bạn rất cần học lập trình cho THU THẬP, BIẾN ĐỔI, áp dụng thuật toán để DỰ ĐOÁN dữ liệu, và cuối cùng là MÔ PHỎNG HÌNH ẢNH/ĐỒ THỊ, và mình gợi ý ngôn ngữ để sau này bạn chuyên dùng nhiều, va chạm nhiều: Python & Scala
Nếu ko thể học đc Python, thì học Scala. Và hiện có rất nhiều khóa miễn phí để học 2 ngôn ngữ này
https://www.youtube.com/watch?v=CmorAWRsCAw&list=PLeo1K3hjS3uuASpe-1LjfG5f14Bnozjwy
https://www.youtube.com/watch?v=DzFt0YkZo8M
4. Vấn đề lo ngại nữa là ko có máy mạnh: năm 2019 rồi, bạn ko cần phải trang bị máy mạnh, AWS AMI có hết máy cho bạn rồi. Chỉ cần bỏ tiền thuê thôi, đâu đó: $0.008/giờ
Cụ thể:
.
.
.
A. THU THẬP
- Bạn cần biết các kiểu thu thập: stream, batch, manually, auto... qua các công cụ: Nifi, Kafa, Flume, Sqoop
- Cần biết thu thập data từ internet, từ iot, từ thiêt bị vận hành, từ camera, từ đài phát thanh
- Cần biết kiểu data nào phù hợp với kiểu lưu dữ liệu nào: file, binary, text, video, images
- Cần biết môi trường để lưu nó: hdfs, ntfs, document db, row db, column db
- Cần biết lọai kiểu DB nào thì tốt cho lưu và lấy ra kiểu gì cho tốc độ, và tốn ít lưu trữ nhất
- Cần biết áp dụng tool thông thường để lấy dữ liệu qua website, internet: webdriver là một ví dụ
.
.
.
B. BIẾN ĐỔI
- Trước khi đưa dữ liệu vào các thuạt toán (mà bên Data Scientist - DS đưa cho chúng ta) bát buộc chúng ta phải biến đổi: kiểu như tùy thuật toán mà có dạng dư liệu đặc trưng, hoặc
- Làm sạch dư liệu: cắt ảnh, cắt sound, chỉnh câu trong text, phân loại câu, tìm danh từ, động từ....Mỗi loại data có kiểu/tool riêng để xử lý.
- Biến đổi sâu:
Về Ảnh:
https://www.facebook.com/KoolJ.InDaHouse/posts/10156133682280079
Về Text:
https://www.facebook.com/KoolJ.InDaHouse/posts/10156133686175079
Về Sound:
https://www.dsprelated.com/freebooks/sasp/Preprocessing.html
- Chỉnh, kiểm tra dữ liệu thiếu, ko đúng...
- Cần hiểu và áp dụng kiểu dữ liệu nào cho THUẠT TOÁN phân tích gì. Hãy hiểu về các kiểu loại dữ liệu đã: liên tục, catalog..
VD:
https://www.wintellect.com/beginning-statistics-for-data-science-types-of-data/
- Có nhiều thuật toán mới từ DS đưa sang, và cần confirm lại dữ liệu họ cần là gì. Và biến đổi phù hợp.
- Tất nhiên ko thể dùng MS SQL, hay Oracle DB để biến đổi cả tỷ bản ghi. Nó sẽ có những công nghệ chuyên biệt để biến đổi, vd: Spark Dataframe
- Tất nhiên ko thể chạy trên ntfs thông thường, mà nó phải đưa trên các hệ db clustering
- Việc query 1 luồng là thông thường cac dev web đang làm. Song nó có những distribute query, vậy các tool có thể làm đc cái đó. Mời bạn Google nhé.
.
.
.
C. DỰ ĐOÁN
- Đôi khi nhiệm vụ của DE, là apply data và thuật toán tư DS cấp và đưa ra những dấu hiệu bất thường, và thông báo cho DS.
- Cũng có thể áp dụng ngay thuật toán sẵn có của 50 năm về trước, hay Google, IBM, với data của bạn
- Nó có thể là timeseries, hoặc logistics regression ai cũng biết. Song nó cũng có thể là một thuật toán do bên DS nghĩ ra
- Cái chính là bạn cần biết một số thông số, và ngưỡng hoàn hảo để xem dữ liệu với công thức đầu ra có phù hợp không. Nếu không phù hợp chạy những dữ liệu lớn hơn. Làm sạch lại dữ liệu.
- Việc đưa data vào ngồi chờ và xem xét output
.
.
.
D. MÔ PHỎNG HÌNH ẢNH/ĐỒ THỊ
- Cần biết với mỗi kiểu, dạng data việc đưa lên đồ thị, vẽ ra như thế nào?... qua Tableau, Power BI, hay treen browser là Canvas.js?
- Học cách áp dụng vẽ lên đồ thị những biểu đồ cần thiết, vd: Tính tổng tăng dần, báo cáo quý, dự đoán timeseries....
.
.
.
E. Tạo ứng dụng thương mại từ nghiep DE
- Cần học thêm:
1. Dựng ứng dụng web tĩnh: học HTML, CSS, JQuery - ít nhất 1 tháng
2. Học Javascript chuyên sâu - ít nhất 1 tháng
3. Học 1 ngôn ngữ serverside, a gợi ý Go - ít nhất 1 tháng
4. Học phát triển ứng dụng mobile: React Native - ít nhất 1 tháng
Gluk@
Trong khi nhà nhà người người đang bàn tán về Data Science thì có rất nhiều team đang thầm lặng cày Business Intelligence và Data Warehouse dạng truyền thống.
Gần 1 năm nay tôi là khách hàng của một team như thế. Phần lớn team này based ở Saigon, cộng thêm rải rác một vài team member ở Indonesia và Sri Lanka
Bọn tôi làm gì?
Giai đoạn này chủ yếu là làm báo cáo, phần lớn tương đối đơn giản như "xuất/nhập/tồn"; "doanh thu/chiết khấu/chi phí/lợi nhuận" - sắp tới sẽ là các dashboards
Khách hàng là ai?
Một tập đoàn thực phẩm cỡ vừa ở Úc và New Zealand, doanh số hàng năm khoảng 0.5 tỷ AUD.
Nguồn dữ liệu đến từ đâu?
Chủ yếu là ERP của khách hàng:
https://www.infor.com/products/infor-os và các hệ thống phụ trợ (phần mềm quản lý chiết khấu bán lẻ, IBM TM1 cho planning và budgeting, dữ liệu bán lẻ từ siêu thị vv) - giai đoạn này 100% là structured data
Bọn tôi dùng công cụ gì?
Bất cứ công cụ gì bọn tôi có trong tay. Hiện nay gần như 100% là Microsoft và Azure: Azure Hyperscale DB, Azure Analysis Services, Azure Data Factory, Azure SQL DW, Power BI v.v. Ngoài ra còn có TimeXtender ETL/DWA và Cognos Analytics. Nhóm có quyền tự chủ tương đối trong việc chọn tool. Với tư cách là khách hàng kiêm team lead, tôi chọn công cụ nào đơn giản và ít phải code nhất. Mục đích là để team tập trung vào business process thay vì viết code
Tại sao lại như thế?
Vì tôi tập trung vào business value hơn là technology showcase. Khách hàng trả tiền cho chúng tôi để giải quyết một số bài toán cụ thể trước mắt, họ không phải là early adopter và hiện nay họ chưa có ý đồ làm data science lab.
Tại sao khách hàng lại chọn team này?
Vì một số thành viên có gần mười năm kinh nghiệm viết báo cáo từ ERP tương tự cho một công ty tương tự ỏ Đông Nam Á. Yếu tố này rút ngắn thời gian tìm hiểu nhu cầu khách hàng, thiết kế data warehouse và viết reports. Trong rất nhiều trường hợp, khách hàng chưa kịp hình dung ra họ muốn gì thì team đã suggest báo cáo gần đúng ý họ. Họ tâm khục khẩu phục vì những thứ đơn giản như thế. Chi phí dành cho chúng tôi thấp hơn hẳn chi phí lập 1 team tương tự ở AU/NZ, đó cũng là yếu tố quan trọng
Tại sao tôi viết post này?
Có vài mục đích. Mục đích chính thứ nhất là bạn nào quan tâm tham gia nhóm, cứ việc email hr@ferntreeservices.com. Công ty này là agency của nhóm, lo liệu các vấn đề trần thế (thu nhập, công cụ làm việc, đào tạo etc etc)
Mục đích phụ thứ 2 là tôi cảm thấy phần lớn các bạn quan tâm quá nhiều vào công cụ (ví dụ nên học Python hay R, SQL hay gì gì) và tập trung quá nhiều vào việc học lý thuyết "chay." Quan niệm cá nhân tôi (không ý kiến nào luôn đúng) là nên tìm bài toán business cụ thể cần giải quyết trước. Sau đó team hoặc cá nhân bạn sẽ tìm ra công cụ tốt nhất tại thời điểm đó để giải quyết vấn đề. Không có bài toán cụ thể thì rất khó hình dung mình đang nỗ lực vì cái gì, cũng như về phía khách hàng, tôi rất khó duy trì funding cho nhóm. Một số bạn đã xin tham gia nhóm, sau đó rút lại vì "em chưa đủ tự tin tiếng Anh" hoặc "em cần vài tháng để học SQL cho cứng" theo tôi là rất đáng tiếc, vì trong vài tháng đó nếu bạn tham gia project cụ thể rất có thể bạn đã rành không những SQL mà còn là những thứ khác sát sườn hơn, ví dụ cơ cấu nhân sự khách hàng, sở thích của họ, phong cách communication etc etc mà không course nào có thể giúp bạnh được
Tôi dùng ảnh minh hoạ từ bài viết này
https://tdwi.org/articles/2017/12/05/bi-all-understanding-differences-data-science-and-bi.aspx theo tôi là một trong những bài rất hay nêu rõ sự khác biệt giữa Data science và BI truyền thống. Cái nào "cool" hơn cái nào thì thời gian mới trả lời được. Cá nhân tôi tránh so sánh trực tiếp vì đây là hai công cụ khác biệt giải quyết hai vấn đề business khác biệt. Về mặt career thì không thể kết luận quá sớm, vì data science tương đối trẻ so với Business intelligence.
Tôi hoàn toàn đồng ý với một câu trong bài viết "It (BI) is expensive and frustrating -- but indispensable". Công nghệ có thể đến rồi đi, nhưng một khi bọn tôi hiểu khách hàng, và liên tục tạo ra giá trị thì bọn tôi không dễ gì thay thế được.
Dành cho bạn nào không đủ kiên nhẫn đọc từng dòng, đây là email để liên hệ hr@ferntreeservices.com
Talk to you soon
:)

Tam Ta Cognos analytics + Power BI + Excel + SSAS cube
Mình
đồng ý với quan điểm cần tập trung vào business process. Lúc đầu bên
mình cũng định build AWS warehouse, tuy nhiên mình đã dừng công đoạn này
để đi nhanh vào phân tích bằng cách coi Netsuite ERP như một data
centre và query thẳng từ Power BI vào. Tập trung vào việc hiểu user
requirement để đưa ra những báo cáo meaningful giúp mang lại value cho
cty nhanh hơn.
Lai Trung Minh Duc Cám ơn anh đã chia sẻ ạ 🙂 Em đồng ý với anh, là tools sẽ qua đi, chỉ có Business value sẽ ở lại, ai nắm giữ và tạo được value thì sẽ win a game.
BI
thì nhìn vào quá khứ, như reflect quá trình, để tìm kiếm vấn đề trong
hiện tại. Còn DS thì tập trung vào forecast nhiều hơn. Cả 2 bổ sung cho
nhau, và em thấy là BI infra sẽ bổ trợ rất tốt cho làm DS sau này.
Tam Ta Anh
đồng ý vụ Infra. Thực ra DW/BI truyền thống hưởng lợi từ một số cơ sở
hạ tầng của Big Data. Polybase là một trong nhiều ví dụ
Tam Ta Điểm
thú vị mà mọi người ít tập trung vào là cả hai đều phải làm data
cleansing trước. Không thì BI xem như vô dụng, còn data science thì sai
số quá lớn. Data cleansing là công việc nhọc nhằn và ít hào quang nên ít
được nhắc đến 😎
Lai Trung Minh Duc Dạ anh.
Trong
quy trình làm DS, em thấy phần Data Collecting và Structuring, rồi Data
Cleansing đóng vai trò quan trọng bậc nhất luôn ấy. Kiểu Machine
Learning hay Deep Learning các thứ như hiện tại thì có library (như
scikit-learn, keras), hay platform
(Azure ML Studio) đã ready cho mình sử dụng rồi. Còn data thì phải
collect vào một chỗ, business user thường hay lưu excel rồi bỏ lung
tung, system thì vướng authorization các thứ, nên để build được cái
dataset ổn định về structure đã khó. Sau đó lại còn phải clean data, lúc
đó lại discuss về định nghĩa outlier, định nghĩa data "xấu" rồi mới
clean được
:v
Nhưng với end user thì họ không care cái bước đó lắm. Họ chỉ muốn biết performance của model thế nào thôi
Sang Huynh Lai Trung Minh Duc
a nói đúng ghê, tụi em đi làm thì hầu như hơn 50% thời gian là giai
đoạn collect, organize và clean data. Các phần sau tính ra lại không vất
vả bằng 😭
Minh Tuệ Bài
viết rất sát thực tế. Em cũng đi theo hướng BI( sử dụng Tableau/ Power
BI) để cung cấp thông tin cho mục đích ra quyết định vận hành/ kinh
doanh.
Thuỳ Dương Tuệ Nhi chị ơi, chị lấy data ở đâu vậy ạ? Em cũng học theo hướng này mà ko biết lấy data ở đâu để phân tích
Minh Tuệ Bạn có thể cài MS SQL Server Express 2017, rồi dùng bộ data TSQL2012 để luyện
Sau đó cứ kiếm việc nào intern rèn luyện qua từng project thôi
Best,
Kent Nguyen: Để hành nghề "data" thì nên có gì?
- Excel, không crack
- Google Spreadsheet, đồ công ty
- Biết Pivot table, vừa đủ
- Biết Code SQL, không cần quá xịn
- Màn hình, càng nhiều càng tốt
- Holistics :v
hay là mở workshop "học cách phân tích 100GB data trong vài giây" đi Huy Nguyen
# Tableau
Cho bạn nào cần document học tableau từ zero to Master [DA - Data Analytic with Tableau]
[Cá nhân không phải CNTT, song muốn kiếm tìm những insight từ data non-bigdata bạn có]
Vừa rồi có khá nhiều anh chị em chia sẻ những cái khó khăn khi họ làm ở
FinTech hoặc một hệ thống, ngành nghề khác với CNTT, và cách anh chị em
đó tiếp cận với việc phân tích dữ liệu, mặc dù nó chưa phải là dữ liệu
lớn đâu, nhưng nó cũng đủ insight để mọi ng có thể .. thương mại đuợc
các dữ liệu đó.
Vậy thực sụ có rất nhiều công cụ để hỗ trợ các anh chị em, tôi đưa ra trải nghiệm một số tools sau a chị em nên theo:
👉1.
Đừng nên tham quá Microsoft Azure, hay IBM Bluemix, hay Databricks,
Hortonworks... vì đó là những hệ thống cho người CNTT. Còn SPSS hay SAS
thì cứ cỡ phải $3k mới dùng ok đc.
Vậy bạn nếu là ko chuyên, mà lại ít tiền bạn cần thử những thứ sau:
👉2.
Tableau: tôi nghĩ đây là công cụ số 1 rất dễ dùng (dễ là cỡ nếu bạn mới
phải 3-4 ngày mới quen), thậm chí cho các bạn dự đoán luôn trên dữ liệu
đang có. Nó có thể live từ nguồn. Support đa nguồn db khác nhau. Có thể
cơ hữu thay đổi GUI map, chart, visual nào bạn thích... song lưu ý là
nó chạy trên client, và server thì... rất đắt. Và nếu sức của bạn ngoài
CNTT, tôi cũng chỉ khuyên dùng client.
Và vì trên client, nên
ram ít, chip ít, nên... chỉ dự đoán cho bạn một dữ liệu bạn sẵn có một
khoảng nào đó thôi. Ví dụ, máy tính core i5 2G, ram 4G bạn có thể view
và xem thoải mái với dữ liệu cỡ 1 triệu dòng, và 20 trường.
Tableau cũng hỗ trợ bạn đưa ra một data show epic nhiều loại khác nhau,
để có thể bạn phục vụ trình chiếu, giới thiệu công ty qua tivi, màn hình
lớn.
Ví dụ một số đúc kết tôi trải nghiệm khi dùng Tableau @ Honda Vinh Phuc VN: bản pdf:
https://1drv.ms/b/s!AoMt1NVPO04zg9AZXx6r9W0FV3egHQ?e=see7xi
Trong forum của tableau ko nói một số thao tác cụ thể khi bạn muốn mở
rộng hoặc custome chart của bạn theo ý của bạn hoăc có vị trí địa lý bạn
cần. Bản thân tôi chat nhiều với chuyên gia Philipine, rồi đào bới khá
nhiều qua internet cả chính thống lẫn những bạn đang làm ....cũng ra khá
khá. Và tôi thấy họ, official tableau expert chưa đủ gọi là expert
(chân thực mà nói - hoặc tôi chưa gặp những ng đủ kiến thức đủ mạnh)
những cái đó tôi tổng kết trong file PDF trên. Tôi nghĩ để tập trung cho
bạn mới học: vậy bạn dùng ngay file pdf trên. Còn các câu hỏi khác bạn
nên đăng ký và hỏi trực tiếp chuyên gia Tableau.
👉3. MS Power BI: Bạn này đc cái mở rộng rất nhiều khoá training tại EDX (ví dụ
https://www.edx.org/…/analyzing-and-visualizing-data-with-p…) mà training rất bài bản. Cái này thì tuơng đuơng với Tableau, mỗi tội bị giói hạn i/o khi dùng thử.
👉4.
Excel, Open Office, Google Sheet, vâng nếu cơ bản là Excel 2007 +
Google Sheet là auto free ở đâu cũng có ở VN này hay là opensource để
trải nghiệm phân tích cơ bản dự đóan cơ bản. Song 2 tool này lại phải
cần quá nhiều thao tác mới đẹp đẽ đc như tool trên. Và nếu học hành bạn
cần nhiều time cỡ 2-3 tháng liên tục. Đôi khi ứng dụng bị nặng khi
Excel/ Open Office ko tối ưu cho dữ liệu visualize.
Cá nhân
khuyên bạn chỉ nên dùng khi chart đơn giản; ko nên dùng những tool này
để view, dự đoán, hay visualize những chart phức tạp.
---------------------
🎯Tốt
nhất bạn nên học một khoá BigData cơ bản để hiểu cơ bản những cái
như... dự đoán, thuật toán cho các bạn ngoài CNTT để cho dễ hiểu hơn,
qua
TesterPRO.org/edu
Welcome!
KJ
file pdf guideline tại Honda: https://1drv.ms/b/s!Ag7iTePLIPMygcVVxSD6DtHvDU1vJg?e=HCte9w
Thực hành ứng dụng Big Data https://www.youtube.com/playlist?list=PL751V5I3RIDF3p62okHvxPC7lUBuLgx5Z&fbclid=IwAR0i1u9f89zbfZcxglhV7jVvjWT2l5Smj8fMuTxXUkR69mo9WvjZNArMwas
Data online course
Mời bạn có thêt bắt đầu với
- Basde06 tại dathoc.net
- Youtube 5h với https://youtu.be/ua-CiDNNj30
- Databricks.com với edx free https://databricks.com/blog/2016/06/01/databricks-to-launch-first-of-five-free-big-data-courses-on-apache-spark.html
- Datacamp.com là https://www.datacamp.com/?utm_source=adwords_ppc&utm_campaignid=1452154985&utm_adgroupid=56070211185&utm_device=m&utm_keyword=%2Bcoursera %2Bdatascience&utm_matchtype=b&utm_network=g&utm_adpostion=1t1&utm_creative=340731356833&utm_targetid=kwd-519678347887&utm_loc_interest_ms=&utm_loc_physical_ms=1028580&gclid=Cj0KCQiA4NTxBRDxARIsAHyp6gA8nP1UylFy29-jUPBCbDxmiQNf01P6TZGsqIN0QehcyZelqhYyLEkaAtv8EALw_wcB
Welcome!
#hardware GPU
Các bạn chạy NVIDIA sao các bạn ý phải chơi RTX?
Có thể là:
1. Họ có gì dùng nấy. Và 3 cái RTX kia có thêt thay thế bằng 1 cái P6000
2. Chi phí họ hạn hẹp? Vậy Jetson Xavier là đủ cỡ $500. Khiêm tốn hơn: Jetson Nano $89 cũng đc
3. Cần processing thì cần vga tốt. Xong inference thì cần ...Pi 4 cũng đủ. Nhưng hơi nóng. Jetson Nano là tối thiểu
Q: tui nghe nói P6000 làm đồ họa tính toán giả lập thôi chứ AI thì gtx hay rtx làm tốt hơn mà giá dễ chịu hơn. có sai gì bạn sửa giùm nhé
A: Tháng 1/1/2019, rtx 2080 là best. Nhưng:
Vì RTX cho desktop bạn.
P cho workstation.
Cuda core của P nhiều hơn RTX. Bit mem nhiều hơn. Tất nhiên price max hơn RTX. Gấp 6 lần.
Và câu hỏi của mình là: họ làm lab sao họ lại dùng desktop. Chắc là cá nhân.
_-----------------------------------------------
# ETL
[QnA]
#koolj_dataengineering
Sáng có bạn có câu hỏi rất hay!
Chào mọi người, cho mình hỏi một chút về việc ETL tổng hợp dữ liệu
Mình đang có bài toán về tổng hợp dữ liệu từ nhiều nguồn (đa số là sql server, có thể có API..) về một database duy nhất để làm nguồn dữ liệu cho việc báo cáo và phân tích, mình đang có vài thắc mắc.
1.Database đích(tạm gọi là dw) nên dùng RDBMS hay NoSQL, khối lượng data khoảng 10trieu transactions một tháng.
2.Nên dùng tools ETL nào để thực hiện việc chuyển đổi dữ liệu, tool có thể thực hiện đồng bộ cả batch job và real time?
3.nếu được mọi người có thể share cho mình vài practice hay các từ khóa có liên quan được không?
Cảm ơn mọi người nhiều.
Nếu có gì chưa rõ mình có thể cung cấp thêm. 😄
====================================================
Hay quá e,
E cứ từ từ tìm hiểu thêm nhé. Đây là gợi ý của a:
1. Loại DB. Chắc chắn phải NoSQL rồi. Xong e chọn loại NoSQL nào. Tuỳ vào dạng data của e:
- text data nên đưa vào db
- file/blob thì lưu xuống file hoặc base64.
Loại DB tuỳ vào e chuyên cái gì và manage đc nó không: Xem bài này để so sanh các loại db: https://www.facebook.com/photo.php?fbid=10156067689220079&set=a.113964400078&type=3
- Document DB cái này tuy nhanh nhưng dung lượng lớn: cớ 500GB cho 100 triệu bản ghi, mỗi bản ghi cỡ 50kb. Đuợc cái đc manage tốt kiểu clustering, và có thể distributed query, và ... đọc ghi fast vì lưu ko cần quan tâm có bao nhiêu truờng dl (field).... cần hỏi đáp thì lại mất phí. Chuyên gia nên dùng. Gợi ý: Couchbase, Cosmos, MongoDB
- Keyvalue based, kiểu hasing, cũng nhanh, được cái tạo multi key primary lẫn second primary key cho e query. Phần value thừa huởng từ Document DB. Rất nhanh. Nhưng cũng dung luợng lớn và phí cao. Cụ thể: AWS Dynamo, Cassandra... về clustering/distribute query phải tự cấu hình. Nếu kỹ năng tốt nên dùng
- Column based: như HBase, Cassandra, Avro (Avro là row based ạ), Parquet... cái này tối lưu cái quét dữ liệu từ table truyền thống sang cột, nên fast đc reading, đc cái tối ưu zip đỡ tốn dung lượng. Nếu trên mất 500 GB, thì có thể chỉ mất 100GB zip nếu cùng column. Tốc độ cũng ko kém. Xem so sanh tốc độ loại này: https://db-blog.web.cern.ch/blog/zbigniew-baranowski/2017-01-performance-comparison-different-file-formats-and-storage-engines
-Graph based: ArangoDB, Neo4J. Cái này vì kéo theo script để tạo graph quan hệ giũa các element nên sẽ chậm và dung lượng lớn. Ko khuyên dùng.
Khá quan trọng khi lấy với mỗi nơi một kiểu, gợi ý
- Nifi là giải pháp chung: cho log, stream, db, file....
- Sqoop+ spark riêng cho MS SQL
- Kafka + spark cho stream, log, và file
Xong chưa hết lấy về phải đưa vào loại db nào, và tổ chức cho dễ query, gọi ý
- Nếu đoán đc loại dữ liệu: đặt key theo loại, vd: ảnh là: img_dssklermcs_00002; sound thì là: sod_retpoiwerlk_0002; log text thì : txt_wripwrlklkj_003
- Nếu không đoán đc cần lưu xong và check xem lại
- Nếu là file (ko đoán đc), nên lưu file và
... vì như thế sau này mới biết mình lưu cái gì ở đâu
2. ETL
- Không nên dùng Pig hay HIve vì chậm, lâu
- Nên dùng Spark + python hoặc scala hoặc java vì nó sẽ nhanh gấp 40 lần các cách khác
Vậy nên xem clip youtube để học cơ bản cách etl từ spark, ví dụ:
https://www.youtube.com/watch?v=m4pYYnY4_gU&list=PLFxgwFEQig6wWDHq3iMfjm5ZCHs_UdIp7
3. Đã nêu trên
Gluk!
----------+