x265中量化函数neon汇编实现分析

2024-04-12 05:44

本文主要是介绍x265中量化函数neon汇编实现分析,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

// uint32_t quant_c(const int16_t* coef, const int32_t quantScale, int32_t* deltaU, int16_t* qCoef, int qBits, int add, int numCoeff)
function x265_quant_neon
    mov             w9, #1  //x9的低32位 = 1
    lsl             w9, w9, w4 //w9 = 1 << qBits;
    dup             v0.2s, w9 //16bits为单位 = w9 2s ? 
    neg             w9, w4 //w4 = 0 - w9
    dup             v1.4s, w9 //v1, 4字节signed = w9
    add             w9, w9, #8 //w8 += 8
    dup             v2.4s, w9 //v2 4字节signed = w9
    dup             v3.4s, w5 //v3 4字节signed = w5 参数add
    
    mov                w11, w1 //w11 = w1 //w11 = quantScale

    lsr             w6, w6, #2 //w6 = w6 >> 2 numCoeff 参数, 一组4个系数
    eor             v4.16b, v4.16b, v4.16b //v4 = 0
    eor             w10, w10, w10 //w10 = 0;
    eor             v17.16b, v17.16b, v17.16b //v17 = 0

.loop_quant:

    ld1             {v18.4h}, [x0], #8 //coef 加载 4个系数,到v18的低64位
    //ld1             {v7.4s}, [x1], #16
    dup             v7.4s, w11 //v7 4字节为单位的signed = quantScale
    sxtl            v6.4s, v18.4h //v18 本来是16bits extern 到 32bits 存入v6

    cmlt            v5.4s, v6.4s, #0 //v5的值小于寄存器v6的值,判断v6 系数是否 > 0

    abs             v6.4s, v6.4s //求绝对值


    mul             v6.4s, v6.4s, v7.4s //系数 = 系数 * qscale  int tmplevel = abs(level) * quantScale;

    add             v7.4s, v6.4s, v3.4s //得到的结果加上偏移, tmplevel += add
    sshl            v7.4s, v7.4s, v1.4s //逻辑左移 qBits 位 

    mls             v6.4s, v7.4s, v0.s[0] //level << qBits  level <<= qBits 存入v6
    sshl            v16.4s, v6.4s, v2.4s //level << qBits >> qBits8 左移 -qBits8 >> 右移qBits8
    st1             {v16.4s}, [x2], #16 //deltaU[blockpos] = ((tmplevel - (level << qBits)) >> qBits8); 数据存入deltaU

    // numsig
    cmeq            v16.4s, v7.4s, v17.4s //v7和v17做比较,结果存储到v16, v17 = 0在这里 
    add             v4.4s, v4.4s, v16.4s //系数个数累加 
    add             w10, w10, #4 //处理了四个系数 

    // level *= sign
    eor             v16.16b, v7.16b, v5.16b //符号位通过异或  这里是相当于取反
    sub             v16.4s, v16.4s, v5.4s // 然后加1
    sqxtn           v5.4h, v16.4s //v16 4字节宽,缩小到2字节, 存储到v5
    st1             {v5.4h}, [x3], #8 //存入量化后的系数,数组 

    subs            w6, w6, #1 //w6 = w6 - 1  处理完一组4个系数
    b.ne             .loop_quant

    addv            s4, v4.4s
    mov             w9, v4.s[0]
    add             w0, w10, w9
    ret
endfunc

这篇关于x265中量化函数neon汇编实现分析的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/896265

相关文章

QT Creator配置Kit的实现示例

《QTCreator配置Kit的实现示例》本文主要介绍了使用Qt5.12.12与VS2022时,因MSVC编译器版本不匹配及WindowsSDK缺失导致配置错误的问题解决,感兴趣的可以了解一下... 目录0、背景:qt5.12.12+vs2022一、症状:二、原因:(可以跳过,直奔后面的解决方法)三、解决方

MySQL中On duplicate key update的实现示例

《MySQL中Onduplicatekeyupdate的实现示例》ONDUPLICATEKEYUPDATE是一种MySQL的语法,它在插入新数据时,如果遇到唯一键冲突,则会执行更新操作,而不是抛... 目录1/ ON DUPLICATE KEY UPDATE的简介2/ ON DUPLICATE KEY UP

Python中Json和其他类型相互转换的实现示例

《Python中Json和其他类型相互转换的实现示例》本文介绍了在Python中使用json模块实现json数据与dict、object之间的高效转换,包括loads(),load(),dumps()... 项目中经常会用到json格式转为object对象、dict字典格式等。在此做个记录,方便后续用到该方

JWT + 拦截器实现无状态登录系统

《JWT+拦截器实现无状态登录系统》JWT(JSONWebToken)提供了一种无状态的解决方案:用户登录后,服务器返回一个Token,后续请求携带该Token即可完成身份验证,无需服务器存储会话... 目录✅ 引言 一、JWT 是什么? 二、技术选型 三、项目结构 四、核心代码实现4.1 添加依赖(pom

SpringBoot路径映射配置的实现步骤

《SpringBoot路径映射配置的实现步骤》本文介绍了如何在SpringBoot项目中配置路径映射,使得除static目录外的资源可被访问,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一... 目录SpringBoot路径映射补:springboot 配置虚拟路径映射 @RequestMapp

Python与MySQL实现数据库实时同步的详细步骤

《Python与MySQL实现数据库实时同步的详细步骤》在日常开发中,数据同步是一项常见的需求,本篇文章将使用Python和MySQL来实现数据库实时同步,我们将围绕数据变更捕获、数据处理和数据写入这... 目录前言摘要概述:数据同步方案1. 基本思路2. mysql Binlog 简介实现步骤与代码示例1

Redis实现高效内存管理的示例代码

《Redis实现高效内存管理的示例代码》Redis内存管理是其核心功能之一,为了高效地利用内存,Redis采用了多种技术和策略,如优化的数据结构、内存分配策略、内存回收、数据压缩等,下面就来详细的介绍... 目录1. 内存分配策略jemalloc 的使用2. 数据压缩和编码ziplist示例代码3. 优化的

基于C#实现PDF转图片的详细教程

《基于C#实现PDF转图片的详细教程》在数字化办公场景中,PDF文件的可视化处理需求日益增长,本文将围绕Spire.PDFfor.NET这一工具,详解如何通过C#将PDF转换为JPG、PNG等主流图片... 目录引言一、组件部署二、快速入门:PDF 转图片的核心 C# 代码三、分辨率设置 - 清晰度的决定因

Java Kafka消费者实现过程

《JavaKafka消费者实现过程》Kafka消费者通过KafkaConsumer类实现,核心机制包括偏移量管理、消费者组协调、批量拉取消息及多线程处理,手动提交offset确保数据可靠性,自动提交... 目录基础KafkaConsumer类分析关键代码与核心算法2.1 订阅与分区分配2.2 拉取消息2.3

SpringBoot集成XXL-JOB实现任务管理全流程

《SpringBoot集成XXL-JOB实现任务管理全流程》XXL-JOB是一款轻量级分布式任务调度平台,功能丰富、界面简洁、易于扩展,本文介绍如何通过SpringBoot项目,使用RestTempl... 目录一、前言二、项目结构简述三、Maven 依赖四、Controller 代码详解五、Service