【友云音】【问题排查记录-2】Agent成环问题

2024-01-03 20:30

本文主要是介绍【友云音】【问题排查记录-2】Agent成环问题,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

问题现象

agent停止,数据上传异常。查询业务数据后发现,业务数据也异常

问题分析

在10.1.228.172的agent目录下的在httpchanle.log中发现,这个机器的agent自发现把10.1.228.176当成了跳板机。

2019-06-18 21:40:38 ReceiverRunable - [ INFO ] 设置自动发现的跳板机IP= 10.1.228.176 
2019-06-18 21:40:39 SendRunable - [ INFO ] 发送ping信号 
2019-06-18 21:40:39 ReceiverRunable - [ INFO ] 接收到10.1.228.172发送的ping信号 
2019-06-18 21:40:39 ReceiverRunable - [ INFO ] 接收到10.1.228.176发送的pong信号

又看了下errorCollection.log,确认了数据确实再向10.1.228.176,发送数据。

2019-06-18 21:46:14 HttpClientUtil - [ ERROR ]  url = https://10.1.228.176:44444/send/api/metric
2019-06-18 21:46:14 ForwardEventSink - [ ERROR ]  Sink send data happends IOException !!
java.io.IOException: Timeout waiting for connection from poolat ycm.agent.util.send.HttpClientUtil.sendPost(HttpClientUtil.java:186)at ycm.agent.util.send.HttpClientUtil.send(HttpClientUtil.java:110)at ycm.agent.util.send.SinkTool.sendPost(SinkTool.java:39)at ycm.agent.appmoni.trace.ForwardEventSink.sendTraceData(ForwardEventSink.java:214)at ycm.agent.appmoni.trace.ForwardEventSink.dealEventData(ForwardEventSink.java:176)at ycm.agent.appmoni.trace.ForwardEventSink.process(ForwardEventSink.java:67)at org.apache.flume.sink.DefaultSinkProcessor.process(DefaultSinkProcessor.java:68)at org.apache.flume.SinkRunner$PollingRunner.run(SinkRunner.java:148)at java.lang.Thread.run(Thread.java:662)

去10.1.228.176看同样日志发现,这台机器的agent把数据发往了10.1.228.173上发送数据。在6月18号晚,云端新架构上线,agent自己连接不到这样所有的agent都这么做,使agent行程了闭环,数据在内网发不出来。

代码逻辑

当有两台以上的服务器能连公网的情况下:

2018年6月~2018年11月这个版本的agent的自发现跳板机逻辑是:如果当前agent检测agent和云端不能通信,那么他就会实时的去找在同一网段的别的机器的agent,认为他是跳板机,把数据发向他。

新版探针,也有这个自发现跳板机的功能,但是加了一层判断,每隔几分钟就检测本agent和云端的通信状况,如果可以通信,就用本agent把数据发往云端,进而避免了成环解不了套的局面。

解决办法

临时解决

重启其中一台agent,让环打开,各自把数据发往云端。

永久解决

更换最新版的探针

这篇关于【友云音】【问题排查记录-2】Agent成环问题的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/566956

相关文章

SpringBoot3应用中集成和使用Spring Retry的实践记录

《SpringBoot3应用中集成和使用SpringRetry的实践记录》SpringRetry为SpringBoot3提供重试机制,支持注解和编程式两种方式,可配置重试策略与监听器,适用于临时性故... 目录1. 简介2. 环境准备3. 使用方式3.1 注解方式 基础使用自定义重试策略失败恢复机制注意事项

Python UV安装、升级、卸载详细步骤记录

《PythonUV安装、升级、卸载详细步骤记录》:本文主要介绍PythonUV安装、升级、卸载的详细步骤,uv是Astral推出的下一代Python包与项目管理器,主打单一可执行文件、极致性能... 目录安装检查升级设置自动补全卸载UV 命令总结 官方文档详见:https://docs.astral.sh/

SpringBoot排查和解决JSON解析错误(400 Bad Request)的方法

《SpringBoot排查和解决JSON解析错误(400BadRequest)的方法》在开发SpringBootRESTfulAPI时,客户端与服务端的数据交互通常使用JSON格式,然而,JSON... 目录问题背景1. 问题描述2. 错误分析解决方案1. 手动重新输入jsON2. 使用工具清理JSON3.

MySQL 设置AUTO_INCREMENT 无效的问题解决

《MySQL设置AUTO_INCREMENT无效的问题解决》本文主要介绍了MySQL设置AUTO_INCREMENT无效的问题解决,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参... 目录快速设置mysql的auto_increment参数一、修改 AUTO_INCREMENT 的值。

关于跨域无效的问题及解决(java后端方案)

《关于跨域无效的问题及解决(java后端方案)》:本文主要介绍关于跨域无效的问题及解决(java后端方案),具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录通用后端跨域方法1、@CrossOrigin 注解2、springboot2.0 实现WebMvcConfig

统一返回JsonResult踩坑的记录

《统一返回JsonResult踩坑的记录》:本文主要介绍统一返回JsonResult踩坑的记录,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录统一返回jsonResult踩坑定义了一个统一返回类在使用时,JsonResult没有get/set方法时响应总结统一返回

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

Go语言中泄漏缓冲区的问题解决

《Go语言中泄漏缓冲区的问题解决》缓冲区是一种常见的数据结构,常被用于在不同的并发单元之间传递数据,然而,若缓冲区使用不当,就可能引发泄漏缓冲区问题,本文就来介绍一下问题的解决,感兴趣的可以了解一下... 目录引言泄漏缓冲区的基本概念代码示例:泄漏缓冲区的产生项目场景:Web 服务器中的请求缓冲场景描述代码

Java死锁问题解决方案及示例详解

《Java死锁问题解决方案及示例详解》死锁是指两个或多个线程因争夺资源而相互等待,导致所有线程都无法继续执行的一种状态,本文给大家详细介绍了Java死锁问题解决方案详解及实践样例,需要的朋友可以参考下... 目录1、简述死锁的四个必要条件:2、死锁示例代码3、如何检测死锁?3.1 使用 jstack3.2

解决JSONField、JsonProperty不生效的问题

《解决JSONField、JsonProperty不生效的问题》:本文主要介绍解决JSONField、JsonProperty不生效的问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑... 目录jsONField、JsonProperty不生效javascript问题排查总结JSONField