Adam Kaufman wrote:
hi all,
I've been trying for the last few days to get heartbeat working with a basic
drbd configuration. I was initially using heartbeat 2.0.8, but eventually
upgraded to 2.1.3. the symptoms exhibited by each version of heartbeat were
completely different, so here I'll focus on 2.1.3, as that's what I'd prefer to
move forward with.
symptoms:
upon starting heartbeat, a monitor command is sent through the drbd resource,
which returns OCF_NOT_RUNNING
the drbd resource(s) is not registered with crm_mon, and cannot be transitioned
into a started state
configuration:
===cib.xml===
<?xml version="1.0" ?>
<cib admin_epoch="17" epoch="1" have_quorum="true" num_updates="0">
<configuration>
<crm_config>
<cluster_property_set id="test_cluster">
<attributes>
<nvpair id="id-symmetric-cluster" name="symmetric-cluster"
value="True"/>
<nvpair id="id-stickiness" name="default-resource-stickiness"
value="INFINITY"/>
</attributes>
</cluster_property_set>
</crm_config>
<nodes/>
<resources>
<primitive class="ocf" id="ip_resource" provider="heartbeat" type="IPaddr"
resource_stickiness="INFINITY">
You should define resource_stickiness as a meta_attribute. It will work
like this, but it is not the best way.
<instance_attributes>
<attributes>
<nvpair name="ip" value="10.107.10.20"/>
<nvpair name="netmask" value="22"/>
<nvpair name="nic" value="eth0"/>
</attributes>
</instance_attributes>
</primitive>
<master_slave id="ms-drbd0">
<meta_attributes id="ma-ms-drbd0">
<attributes>
<nvpair id="ma-ms-drbd0-1" name="clone_max" value="2"/>
<nvpair id="ma-ms-drbd0-2" name="clone_node_max" value="1"/>
<nvpair id="ma-ms-drbd0-3" name="master_max" value="1"/>
<nvpair id="ma-ms-drbd0-4" name="master_node_max" value="1"/>
<nvpair id="ma-ms-drbd0-5" name="notify" value="yes"/>
<nvpair id="ma-ms-drbd0-6" name="globally_unique" value="false"/>
<nvpair id="ma-ms-drbd0-7" name="target_role" value="stopped"/>
You don't want the resource to be started. That's why the score is
-INFINITY.
</attributes>
</meta_attributes>
<primitive class="ocf" id="drbd0" provider="heartbeat" type="drbd"
resource_stickiness="INFINITY">
see above
<instance_attributes id="ia-drbd0">
<attributes>
<nvpair id="ia-drbd0-1" name="drbd_resource" value="drbd0"/>
</attributes>
</instance_attributes>
</primitive>
</master_slave>
</resources>
<constraints>
<rsc_location id="run_ip_resource" rsc="ip_resource">
<rule id="pref_run_ip_resource" score="100">
<expression attribute="#uname" operation="eq" value="plat-pc-18"/>
</rule>
</rsc_location>
</constraints>
</configuration>
<status/>
</cib>
===drbd.conf===
resource drbd0 {
protocol C;
incon-degr-cmd "echo 'incon-degr-cmd'";
startup {
degr-wfc-timeout 120;
}
disk {
on-io-error pass_on;
}
net {
on-disconnect reconnect;
}
syncer {
rate 100M;
group 1;
al-extents 257;
}
# Begin chassis configuration
on plat-pc-18 {
device /dev/drbd0;
disk /dev/mapper/nrStorage-storage;
address 10.107.10.38:7789;
meta-disk internal;
}
on plat-pc-17 {
device /dev/drbd0;
disk /dev/mapper/nrStorage-storage;
address 10.107.10.37:7789;
meta-disk internal;
}
}
debug output:
===crm_verify -LVVVV===
crm_verify[7494]: 2008/02/28_17:15:14 info: main: =#=#=#=#= Getting XML
=#=#=#=#=
crm_verify[7494]: 2008/02/28_17:15:14 info: main: Reading XML from: live cluster
crm_verify[7494]: 2008/02/28_17:15:14 notice: main: Required feature set: 2.0
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'stop' for cluster option 'no-quorum-policy'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'false' for cluster option 'stonith-enabled'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'reboot' for cluster option 'stonith-action'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value '0' for cluster option 'default-resource-failure-stickiness'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'true' for cluster option 'is-managed-efault'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value '60s' for cluster option 'cluster-delay'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value '30' for cluster option 'batch-limit'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value '20s' for cluster option 'default-action-imeout'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'true' for cluster option 'stop-orphan-resources'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'true' for cluster option 'stop-orphan-actions'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'false' for cluster option 'remove-after-top'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value '-1' for cluster option 'pe-error-series-max'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value '-1' for cluster option 'pe-warn-series-max'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value '-1' for cluster option 'pe-input-series-max'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'true' for cluster option 'startup-fencing'
crm_verify[7494]: 2008/02/28_17:15:14 debug: cluster_option: Using default
value 'true' for cluster option 'start-failure-is-fatal'
crm_verify[7494]: 2008/02/28_17:15:14 debug: unpack_config: Default action
timeout: 20s
crm_verify[7494]: 2008/02/28_17:15:14 debug: unpack_config: Default stickiness:
1000000
crm_verify[7494]: 2008/02/28_17:15:14 debug: unpack_config: Default failure
stickiness: 0
crm_verify[7494]: 2008/02/28_17:15:14 debug: unpack_config: STONITH of failed
nodes is disabled
crm_verify[7494]: 2008/02/28_17:15:14 debug: unpack_config: Cluster is
symmetric - resources can run anywhere by default
crm_verify[7494]: 2008/02/28_17:15:14 debug: unpack_config: On loss of CCM
Quorum: Stop ALL resources
crm_verify[7494]: 2008/02/28_17:15:14 info: determine_online_status: Node
plat-pc-18 is online
crm_verify[7494]: 2008/02/28_17:15:14 info: determine_online_status: Node
plat-pc-17 is online
crm_verify[7494]: 2008/02/28_17:15:14 notice: native_print: ip_resource
(heartbeat::ocf:IPaddr): Started plat-pc-18
crm_verify[7494]: 2008/02/28_17:15:14 notice: clone_print: Master/Slave Set:
ms-drbd0
crm_verify[7494]: 2008/02/28_17:15:14 notice: native_print: drbd0:0
(heartbeat::ocf:drbd): Stopped
crm_verify[7494]: 2008/02/28_17:15:14 notice: native_print: drbd0:1
(heartbeat::ocf:drbd): Stopped
crm_veriy[7494]: 2008/02/28_17:15:14 debug: native_print: Allocating:
ip_resource (heartbeat::ocf:IPaddr): Started plat-pc-18
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: Color
ip_resource, Node[0] plat-pc-18: 1000000
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: Color
ip_resource, Node[1] plat-pc-17: 0
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: Assigning
plat-pc-18 to ip_resource
crm_verify[7494]: 2008/02/28_17:15:14 notice: NoRoleChange: Leave resource
ip_resource (plat-pc-18)
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_print: Allocating: drbd0:0
(heartbeat::ocf:drbd): Stopped
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: Color drbd0:0,
Node[0] plat-pc-17: -1000000
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: Color drbd0:0,
Node[1] plat-pc-18: -1000000
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: All nodes for
resource drbd0:0 are unavailable, unclean or shutting down
crm_verify[7494]: 2008/02/28_17:15:14 WARN: native_color: Resource drbd0:0
cannot run anywhere
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_print: Allocating: drbd0:1
(heartbeat::ocf:drbd): Stopped
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: Color drbd0:1,
Node[0] plat-pc-17: -1000000
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: Color drbd0:1,
Node[1] plat-pc-18: -1000000
crm_verify[7494]: 2008/02/28_17:15:14 debug: native_assign_node: All nodes for
resource drbd0:1 are unavailable, unclean or shutting down
crm_verify[7494]: 2008/02/28_17:15:14 WARN: native_color: Resource drbd0:1
cannot run anywhere
crm_verify[7494]: 2008/02/28_17:15:14 debug: clone_color: Allocated 0 ms-drbd0
instances of a possible 2
crm_verify[7494]: 2008/02/28_17:15:14 info: master_promotion_order: Merging
weights for ms-drbd0
crm_verify[7494]: 2008/02/28_17:15:14 debug: master_color: drbd0:0 master
score: 0
crm_verify[7494]: 2008/02/28_17:15:14 debug: master_color: drbd0:1 master
score: 0
crm_verify[7494]: 2008/02/28_17:15:14 info: master_color: ms-drbd0: Promoted 0
instances of a possible 1 to master
crm_verify[7494]: 2008/02/28_17:15:14 debug: master_create_actions: Creating
actions for ms-drbd0
crm_verify[7494]: 2008/02/28_17:15:14 debug: child_starting_constraints:
ms-drbd0 has no active children
crm_verify[7494]: 2008/02/28_17:15:14 debug: child_stopping_constraints:
ms-drbd0 has no active children
Warnings found during check: config may not be valid
crm_verify[7494]: 2008/02/28_17:15:14 debug: cib_native_signoff: Signing out of
the CIB Service
===crm_mon -1===
============
Last updated: Thu Feb 28 17:18:01 2008
Current DC: plat-pc-18 (4e5d0f81-9b89-4698-8251-27358cbfd7db)
2 Nodes configured.
2 Resources configured.
============
Node: plat-pc-17 (bf23e96c-d374-4f17-b457-fcfbeb2a616c): online
Node: plat-pc-18 (4e5d0f81-9b89-4698-8251-27358cbfd7db): online
ip_resource (heartbeat::ocf:IPaddr): Started plat-pc-18
-------------------------------------------------------------------------------
it seems like the score for the drbd resource is stuck at -INFINITY, which
would explain why heartbeat refuses to run it. it says that there may be
errors in the configuration, but it's so simple, I can't see where they could
be. any suggestions?
thanks so much
-adam
Regards
Dominik
_______________________________________________
Linux-HA mailing list
[email protected]
http://lists.linux-ha.org/mailman/listinfo/linux-ha
See also: http://linux-ha.org/ReportingProblems