机器学习_介绍篇章
😀 这里写文章的前言:机器学习三大范式(监督/无监督/强化)与深度网络的关系;回归 vs 分类;输入类型(表格、序列、图像、图结构);模型作为函数族 + 训练数据选择具体函数;生成模型与潜变量
📝 机器学习的三大范式与深度网络关系核心关系深度神经网络是目前最强大、最实用的一类机器学习模型。将深度网络应用到数据上的过程称为深度学习。深度网络并非三大范式本身,而是实现这三大范式的核心工具/模型家族。三大范式定义了“学什么、如何学”的问题类型和目标,而深度网络提供了强大的函数逼近能力,使这些范式在复杂、高维、结构化数据上取得当前最佳性能。
监督学习:深度网络学习从输入 x 到输出 y 的映射 y=f[x,ϕ]。
无监督学习:深度网络学习数据的内在结构或概率分布(生成模型)。
强化学习:深度网络常被用来表示策略(从状态到动作的映射)或价值函数。
三大范式是否可以通过深度网络实现?是的,完全可以,而且目前最前沿的实现几乎都依赖深度网络。
具体说明如下:
(1)监督学习
定义:从带标签的输入-输出对中学习映射关系。
深度网络实现方式:
网络作为函 ...
Antlr4-解析入门一
😀 这里写文章的前言:为什么需要解析SQL?解析完SQL后又能做什么?0. 校验SQL的语法是否合规
数据安全需要解析SQL获取出对应的的操作
数据血缘的抽取需要解析SQL
类似Hive/Spark等在将SQL转化为mr,执行计划等的时候,也是需要解析SQL的
等等;欢迎你来补充更多需要解析SQL的话题
📝 解析的方法
项目名称
适合的数据库
项目地址
个人观点
JSqlParser
RDBMS
⚠️[此处原为Notion外部链接预览,URL待补充]
目前只适合关系型的数据库,对于大数据很多领域的数据库目前还不是特别支持
calcite
Cassandra、Druid、Elasticsearch、MongoDB、Kafka,FlinkSQL等
https://github.com/apache/calcite/tree/main
后续再补
antlr
可以借助 grammars-v4 这个项目提供,可以解析很多数据库以及编程语言等都可以解析的
antlr4项目:https://github.com/antlr/antlr4语法校验项目 ...
生活碎碎念_多做少想
😀 这是一篇记录生活的碎碎念:欢迎你阅读我的碎碎念,非常感谢稍微学会下记录生活或者想法,毕竟年纪大了,很容易忘记一些事包括之前一些有的没得
📝 多做少想的实际行动想多了全是问题,做多了全是答案。想得再多都是焦虑,做得再少也算进步
个人含义理解
减少自己的胡思乱想,既然决定了前行的方向和目标,就不断的坚持和走下去;假设你不断的停留在不停不停不停的空想上,肯定是没有直接开始做得出来的好;并且随着你想着你越多,你放弃的可能程度也是不断的提升,但是你在整个过程中,是没有任何开始和行动的
所以,让自己行动起来,去贯彻做起来的主义,哪怕再少,也是在持续的不断前进
学会主动远离一些人,告别自己的恋爱脑远离那些让你内耗的人经历了漫长的一段时间的自我内耗,就搁那么一丢丢给自己整没了;索性好在突然的醒悟;从醒悟到现在差不多快2个月了吧,坚持着做许多自己当初没做的事情
去慢慢逐渐告别了内耗
远离那些背叛过的人此处借助张爱玲的一句话,来完全诠释这个二级标题的含义:
人家撇下你的那一刻,一定是觉得某个瞬间没有你,他会生活得更好,那一刻,一辈子都不值得原谅
所以对于有过背叛的人,只会给你非常清醒的 ...
摄影笔记
😀 这里写文章的前言:看摄影文章进行一个笔记记录一个合格的摄影师可以恰当利用镜头虚化所带来的视觉效果,主动控制虚化范围
文件格式:
RAW: 相机能记录的不加任何渲染的原始图片格式
JPEG: 相机经过自己的系统和算法算出来的图片
📝 光圈简介光圈是镜头里用来控制镜头孔径大小的部件
孔越小,通过的光自然就越少,相机的感光原件接收到的光少了,画面就会越暗;孔越大,通光量越大,画面就越亮
f值小的是大光圈,f值大的是小光圈
在不考虑镜头焦段的情况下,同一枚镜头,光圈越大,景深越浅(照片中清晰的范围越小);光圈越小,景深越大(照片中清晰的范围越大)
看背景后的问题;可以看到f越大,背景其越清晰
物距: 相机离物理的距离;物距越近,景深也就越浅
长焦镜头: 压缩画面,压缩空间感
焦段越长,视角越窄,景深越浅,透视畸变越弱;焦段越短,视角越宽,景深越大,透视畸变越强
📝 ISO感光度: 感光度就是相机对光的敏感程度; ISO其实是把ASA和DIN捏合在一起的一种计量单位
比如
如果我们把相机感光度从 ISO 400 调低到 ISO 200,这就等于感光元件的感光能力减小了一倍 ...
开源数据平台_技术篇章
😀 这里写文章的前言:计划一个开源的数据平台; 参考许多数据中台的公司产品 以及 开源项目,进行一个整体的总结;可以大致归纳到如下一些点
离线
实时
算法
数据服务开发
数据质量检查
数据安全
数据资产
调度任务
环境模块
📝系统配置最大力度以项目为隔离,来进行隔离 资源/用户/环境 等信息
进行如下的内容配置:
部门 & 租户
用户 & 角色
项目 ——> 项目资源(比如yarn,hdfs存储资源,数据源,集群资源)
业务流程(每个项目下有多个业务流程)
项目配置(比如这个项目的默认参数等)
📝离线开发开发系统设置
数据交换 和 数据集成 : 数据的同步,数据库的同步,csv/execl同步,非结构化数据同步
数据开发
传统数据库 : MySql / GaussDB / Oracle / PostgreSQL / SqlServer / DB2 等数据库
大数据组件: Spark(Sparl/SparkSql/pySpark) ...
插件推荐
😀 这里写文章的前言:记录各种软件好用的插件
📝 Google浏览器插件沉浸式翻译这里我已 Spring 官网为例,它会翻译每段,效果还是很好的
Sexy Undo Close Tab记录你刚刚关闭的网页,不小心关错了,再也不用去历史记录中进行查找
SuperCopy 超级复制一键破解禁止右键、破解禁止选择、破解禁止复制、破解禁止粘贴,启用复制,启用右键,启用选择,启用粘贴
Chrono下载管理器比如我们有时候找一个网站的静态资源,就可以直接用这个插件的 资源嗅探 功能
Octotree - GitHub code tree当我们访问 github 项目的时候,就不需要挨个点进去看,通过旁边的 ctotree 就可以看到项目的层级等
微信公众号同步助手微信公众号文章同步助手,支持头条号、简书、知乎、WordPress
WebChatGPT📝 Notion插件Notion流程图插件
Diagrams.net:这个插件是Notion的官方合作伙伴插件,它提供了丰富的绘图工具,包括流程图、组织结构图、UML图等。您可以使用它来在Notion中创建专业的流程图。
Excali ...
编译问题记录和各种环境配置
😀 这里写文章的前言:记录编译各种项目以及开源项目遇到的问题
本地安装jar包pentaho-aggdesigner-algorithm-5.1.5-jhydeeigenbase-properties-1.1.4greenplum-jdbc-5.1.4
📝 缺少jar包本地编译pentaho-aggdesigner-algorithm-5.1.5-jhydejar包
📎 pentaho-aggdesigner-algorithm-5.1.5-jhyde.jar
本地安装指令: -Dfile 切换为自己本地下载存放jar的位置
mvn install:install-file -Dfile=/home/luohong/Downloads/pentaho-aggdesigner-algorithm-5.1.5-jhyde.jar -DgroupId=org.pentaho -DartifactId=pentaho-aggdesigner-algorithm -Dversion=5.1.5-jhyde -Dpackaging=jar
eigenbase-properties-1 ...
数据中台(技术篇章)
😀 这里写文章的前言:数据中台技术记录
📝 数据底座
CDH闭源前的最后一个版本
CDP
USDP
DataSophon
📝 数据交换(数据集成)从各种数据源采集结构化和非结构化数据,包括实时数据采集和批量数据采集
将来自不同系统和不同格式的数据进行整合,实现一个统一个的数据视图
数据交换
API: 采集第三方的API的数据
日志采集: 采集应用日志
爬虫: 采集网页数据
数据源抽取: 直接通过数据源进行抽取
数据集成数据提取(Data Extraction)数据清洗(Data Cleaning)数据转换(Data Transformation)数据加载(Data Loading)数据清洗对采集的数据进行过滤、修正、归一化等,提高数据质量,修复脏数据。
📝 数据开发离线开发
Spark
Hive
Flink
实时开发
Kafka
Spark Streaming
Flink
算法开发暂不支持
📝 任务调度
Azkaban
Airflow
海滩调度器
📝 数据可视化通告报表,dashboard等对数据和洞见进行直观的展示;帮助用户理解和决策
Apache S ...
数仓开发规范
😀 这里写文章的前言:数仓开发规范
📝 ETL规范(Execl文件)文档规范execl表头记录所有表的信息,类似mysql的索引
序号
层次类别
表名
中文名称
备注
1
ods
user_list
用户信息
用户信息
单个表记录(单个execl页)
表英文名
dwd_ls_md_item_store_df
设计人
鲍洋
表备注
商品门店级别
备注
每天做快照,根据后期需求,再扩展计算指标
ETL策略
日全量
源表基本信息
表中文名称
表英文名称
别名
数据总量
商品所有基本信息
ods_erp.o_bas_club_item
ci
835943
商品所有基本信息1
ods_erp.o_bas_club_item1
ci1
835943
表关联关系描述
源表别名1
关联类型
源表别名2
备注
ci
inner join
ci1
字段映射描述(组1)
目标表
源表
规则
列名
字段类型
列描述
列名
club ...
hadoop以及Iceberg在win10运行环境配置
😀 这里写文章的前言:一个简单的开头,简述这篇文章讨论的问题、目标、人物、背景是什么?并简述你给出的答案。
可以说说你的故事:阻碍、努力、结果成果,意外与转折。
📝 下载包准备hadoop下载下载地址:https://archive.apache.org/dist/hadoop/common/
选择我们对应的hadoop版本;比如我这里是是3.1.1就选择3.1.1
win10 需要的脚本下载https://github.com/cdarlint/winutils/tree/master
选择我们对应的hadoop的版本
对应版本的脚本拷贝操作一将 hadoop.ddl 和 winutils.exe 拷贝到 下载的hadoop的版本的bin中
操作二将 hadoop.ddl 文件同时拷贝一份到 C:\Windows\System32 目录
操作三配置hadoop中的etc\hadoop的 hadoop-env.cmd 文件的java地址;切换为自己的java路径;
如果是C盘的话,Program Files需要替换为 PROGRA~1 ; 如下
set JAVA_H ...




