【发布时间】:2012-01-03 01:03:56
【问题描述】:
我正在调查我们的服务存在的问题,该问题无法解析负载下的 s3 存储桶名称。
我强调的是单个 c1.medium ec2 实例:
root@ip-10-243-126-111:/mnt/log# uname -a
Linux ip-10-243-126-111 2.6.35-30-virtual #56-Ubuntu SMP Mon Jul 11 23:41:40 UTC 2011 i686 GNU/Linux
root@ip-10-243-126-111:/mnt/log# cat /etc/issue
Ubuntu 10.10 \n \l
root@ip-10-243-126-111:/mnt/log# free
total used free shared buffers cached
Mem: 1746008 1681752 64256 0 29600 1582508
-/+ buffers/cache: 69644 1676364
Swap: 917500 32 917468
应用程序正在使用-server, jvm build 1.6.0_23-b05, 32bit 运行
我看到的行为是网络通信开始“表现得很有趣”,有时我们的 mongo 连接驱动程序会发生套接字超时,如下所示:
Caused by: java.net.SocketTimeoutException: Read timed out
at java.net.SocketInputStream.socketRead0(Native Method) ~[na:1.6.0_23]
at java.net.SocketInputStream.read(SocketInputStream.java:129) ~[na:1.6.0_23]
at java.io.BufferedInputStream.fill(BufferedInputStream.java:218) ~[na:1.6.0_23]
at java.io.BufferedInputStream.read1(BufferedInputStream.java:258) ~[na:1.6.0_23]
at java.io.BufferedInputStream.read(BufferedInputStream.java:317) ~[na:1.6.0_23]
at org.bson.io.Bits.readFully(Bits.java:35) ~[mongo-java-driver-2.5.3.jar:na]
at org.bson.io.Bits.readFully(Bits.java:28) ~[mongo-java-driver-2.5.3.jar:na]
at com.mongodb.Response.<init>(Response.java:35) ~[mongo-java-driver-2.5.3.jar:na]
at com.mongodb.DBPort.go(DBPort.java:110) ~[mongo-java-driver-2.5.3.jar:na]
at com.mongodb.DBPort.go(DBPort.java:75) ~[mongo-java-driver-2.5.3.jar:na]
at com.mongodb.DBPort.call(DBPort.java:65) ~[mongo-java-driver-2.5.3.jar:na]
at com.mongodb.DBTCPConnector.call(DBTCPConnector.java:201) ~[mongo-java-driver-2.5.3.jar:na]
... 43 common frames omitted
有时会发生以下情况
Caused by: java.net.UnknownHostException: bucket-system.s3.amazonaws.com
at java.net.InetAddress.getAllByName0(InetAddress.java:1158) ~[na:1.6.0_23]
at java.net.InetAddress.getAllByName(InetAddress.java:1084) ~[na:1.6.0_23]
at java.net.InetAddress.getAllByName(InetAddress.java:1020) ~[na:1.6.0_23]
at org.apache.http.impl.conn.DefaultClientConnectionOperator.resolveHostname(DefaultClientConnectionOperator.java:242) ~[httpclient-4.1.jar:4.1]
at org.apache.http.impl.conn.DefaultClientConnectionOperator.openConnection(DefaultClientConnectionOperator.java:130) ~[httpclient-4.1.jar:4.1]
at org.apache.http.impl.conn.AbstractPoolEntry.open(AbstractPoolEntry.java:149) ~[httpclient-4.1.jar:4.1]
at org.apache.http.impl.conn.AbstractPooledConnAdapter.open(AbstractPooledConnAdapter.java:121) ~[httpclient-4.1.jar:4.1]
at org.apache.http.impl.client.DefaultRequestDirector.tryConnect(DefaultRequestDirector.java:562) ~[httpclient-4.1.jar:4.1]
at org.apache.http.impl.client.DefaultRequestDirector.execute(DefaultRequestDirector.java:415) ~[httpclient-4.1.jar:4.1]
at org.apache.http.impl.client.AbstractHttpClient.execute(AbstractHttpClient.java:820) ~[httpclient-4.1.jar:4.1]
at org.apache.http.impl.client.AbstractHttpClient.execute(AbstractHttpClient.java:754) ~[httpclient-4.1.jar:4.1]
at org.apache.http.impl.client.AbstractHttpClient.execute(AbstractHttpClient.java:732) ~[httpclient-4.1.jar:4.1]
at com.amazonaws.http.AmazonHttpClient.executeHelper(AmazonHttpClient.java:240) ~[aws-java-sdk-1.2.5.jar:na]
... 48 common frames omitted
这是可重现的,但不一致。一旦机器上开始加载(50 个并发 http 请求),机器就会在正确响应周期之间切换约 5 分钟,然后所有请求失败约 10 秒,然后是另一个正确响应周期。
什么会导致这种行为?是否有任何 ulimit 或其他系统设置我可以尝试调整以改进这一点?还有什么线索可以搜索吗?
我怀疑的另一个选项是亚马逊(us-east-1 区域)的基础设施,我怀疑那里的路由器对服务启用了某种 DoS 预防策略,因为请求几乎立即从 0 跳转到 50 . 一段时间后,它稳定在稳定的 50 并发率上,此时硬件会适应新的流量。牵强?我在任何地方都没有发现任何提到这种类型的模式。
【问题讨论】:
-
您能检查一下您的 java.security 策略文件中的值
networkaddress.cache.ttl吗?默认设置是永久缓存名称服务查找的结果,但如果该值为 300(=5 分钟),那么这可能是对您的周期的解释。
标签: java linux load amazon-ec2 linux-kernel