How do I prevent Google Sheets' ImportXML from dropping all the HTML (divs, spans, etc.)?

Viewed 13

Where A1 is:

https://resources.allsetlearning.com/gramwiki/?title=Emphasizing_quantity_with_%22dou%22&action=edit

and the formula is:

=IMPORTXML(A1,"//*[@id='wpTextbox1']")

the output is (excerpted here):

**大家* *都* 来 了 吗?*Dàjiā* *dōu* lái le ma?Is everyone here? **大家* *都* 应该 知道。
*Dàjiā* *dōu* yīnggāi zhīdào.Everyone should know. **大家* *都* 说 你 很 聪明。*Dàjiā 
* *dōu* shuō nǐ hěn cōngming.Everyone says you're smart. **大家* *都* 忘 了 他 的 
名字。*Dàjiā* *dōu* wàng le tā de míngzi.Everyone forgot his name. **大家* *都* 
喜欢 吃辣 吗?*Dàjiā* *dōu* xǐhuan chī là ma?Does everyone like eating spicy 
food?

The problem with the above is, it's adding return carriages and dropping all the good stuff I need to parse out the spans I want, from the source (excerpt):

<div class="liju">
 
*<strong>大家</strong> <em>都</em> 来 了 吗?<span class="pinyin"><strong>Dàjiā</strong> <em>dōu</em> lái le ma?</span><span class="trans">Is everyone here?</span>
*<strong>大家</strong> <em>都</em> 应该 知道。<span class="pinyin"><strong>Dàjiā</strong> <em>dōu</em> yīnggāi zhīdào.</span><span class="trans">Everyone should know.</span>
*<strong>大家</strong> <em>都</em> 说 你 很 聪明。<span class="pinyin"><strong>Dàjiā </strong> <em>dōu</em> shuō nǐ hěn cōngming.</span><span class="trans">Everyone says you're smart.</span>
*<strong>大家</strong> <em>都</em> 忘 了 他 的 名字。<span class="pinyin"><strong>Dàjiā</strong> <em>dōu</em> wàng le tā de míngzi.</span><span class="trans">Everyone forgot his name.</span>
*<strong>大家</strong> <em>都</em> 喜欢 吃辣 吗?<span class="pinyin"><strong>Dàjiā</strong> <em>dōu</em> xǐhuan chī là ma?</span><span class="trans">Does everyone like eating spicy food? 
</span>

</div>

How do I prevent ImportXML from butchering this?

0 Answers
Related