{"as_of":"2026-08-18T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f21c8e69f5f9ed314bf0800f6e8b1abeb6e7b027e11ce929e1450b5c58d50da7","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T06:05:08.031095Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.19668/citation-record","integrity":"/paper/2411.19668/integrity","json":"/paper/2411.19668/citation-record.json","paper":"/paper/2411.19668"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.893556Z","title":"Chinesewebtext: Large-scale high-quality chinese web text extracted with effective evaluation model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.893556Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:1b360477a923f051e46c071ff77a3f4e4f02feb4e2194d5d6a191abb4db1c835","observation_id":"05e88a92-defd-4538-846f-61afcefb92a4","resolution":{"observed_at":"2026-08-12T06:05:07.893556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.897627Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.897627Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:24b7a8f715d559420cb91cf2ac88b389313937b1bbd5e12a336e01eb75e3d69b","observation_id":"b1a15ec9-7648-4eb8-ba2d-7e74041b7c81","resolution":{"observed_at":"2026-08-12T06:05:07.897627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-12T06:05:07.901849Z","title":"The Pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.901849Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:1cc7eb949ea5a7235c25b3b3dcb96d1c157a13ab0b209c0a82d3d8a18684d751","observation_id":"139b9431-1aae-47cb-bed3-d0047c441363","resolution":{"observed_at":"2026-08-12T06:05:07.901849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.409603Z","title":"Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models, 2023","venue":null,"work_id":"962e5042-6c45-4d7a-ac80-3877b16f168d","year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.905661Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:7b61c1fcd600f290c275cf2db3692fd75d5db64d4fb9940389defc6cfb5846e7","observation_id":"b07256d7-92e0-46a9-a68f-60ceb30f9ed3","resolution":{"observed_at":"2026-08-12T06:05:08.413252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.398716Z","title":"Chinese tiny llm: Pretraining a chinese-centric large language model, 2024","venue":null,"work_id":"8126499f-6016-4f2e-9cd5-a404caa1e2a5","year":2024},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.909125Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:bf9540a937fec4ef19f2591d1907f79783e6c477cdce1d355f38cd0c0ba790d6","observation_id":"8a2e532a-910a-484f-ace5-6ade2d74fb78","resolution":{"observed_at":"2026-08-12T06:05:08.402548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-12T06:05:07.912679Z","title":"Bloom: A 176b-parameter open-access multilingual language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.912679Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:9854abb957c76375d380039ac7d24601d8636120a517effdf8942278e569e46a","observation_id":"56336261-4f0d-4c14-992b-b5c9bc43eaad","resolution":{"observed_at":"2026-08-12T06:05:07.912679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.916718Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.916718Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:f8cd1fec83a162d73eb13b2826ae8bcdb82c04f85378cb364a67bbdad511f442","observation_id":"790eb458-1411-4244-9833-2ce8f27ebf9a","resolution":{"observed_at":"2026-08-12T06:05:07.916718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.923279Z","title":"The refinedweb dataset for falcon llm: Outperforming curated corpora with web data, and web data only, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.923279Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:836d761f2f39f0f633050009729d03122db692ebc9aa3b997d3a099c2af441ae","observation_id":"e26c9290-b789-4461-bc00-a7f1bf8b227e","resolution":{"observed_at":"2026-08-12T06:05:07.923279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.928360Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.928360Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:e9192cddee2479fa81341a44bdaeac3db29bba9ee46d3b3804ef340984f49730","observation_id":"663fecf8-37e5-4cb0-8dca-4885c27f6d51","resolution":{"observed_at":"2026-08-12T06:05:07.928360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-12T06:05:07.931326Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.931326Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:0f4e3cb3d15bef40692925ef0354c04387c44f361583ed777aa44912c4b93010","observation_id":"50b2cacc-e86a-4652-96fd-e697b2878589","resolution":{"observed_at":"2026-08-12T06:05:07.931326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T06:05:07.934433Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.934433Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:959e04a5e0260ce09969c4e3733d7ee2ce06f5c7df542e8c2e6245d5f9eaabc5","observation_id":"bad9a8e2-aeee-4b88-8155-2cdaf4e94dbc","resolution":{"observed_at":"2026-08-12T06:05:07.934433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T06:05:07.937173Z","title":"Corr, abs/2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.937173Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:81927feedcd100b665ebd016a871d57a67db07443e277b254a66776362e0c628","observation_id":"2b0a0f24-1146-4435-9051-0409bf92f163","resolution":{"observed_at":"2026-08-12T06:05:07.937173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.369260Z","title":"Learning to reason with llms","venue":null,"work_id":"2b29cb6a-ea63-40db-8c25-66be293daebb","year":2024},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.939779Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:46582cbf4666a3e88e086c49935c036757eb4b54e978ab82ba789914bec5049e","observation_id":"64913b34-c84c-4e31-b37f-6a4adee0ec5e","resolution":{"observed_at":"2026-08-12T06:05:08.372687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.359485Z","title":"Wudaocorpora: A super large-scale chinese corpora for pre-training language models","venue":null,"work_id":"4a2761ba-2794-41d4-92d9-354b1e171287","year":2021},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.942244Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:cc4f8a48ae367de96630bdacdd3c101efcf7618795736d1e43e7135e304b20e8","observation_id":"86fd619b-7d1d-4fd1-b45f-21e31d642cd1","resolution":{"observed_at":"2026-08-12T06:05:08.362968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.349388Z","title":"Yuan 1.0: Large-scale pre-trained language model in zero-shot and few-shot learning, 2021","venue":null,"work_id":"5a3173b2-662c-48ac-a663-f8f805b51c71","year":2021},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.944794Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:feb7a2d4bf8f7aaeadca64b536ac7e28dbb94c2f06dadf3829a71537857ec504","observation_id":"3138052c-2346-4e0e-a228-6c2359befc13","resolution":{"observed_at":"2026-08-12T06:05:08.352719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.947236Z","title":"Skywork: A more open bilingual foundation model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.947236Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:43d12bea69e4de0687d7539dfb0ea93a30d6be85fff970c3078bd498d6c75e56","observation_id":"0431466d-876a-433b-8c90-d06953ce380a","resolution":{"observed_at":"2026-08-12T06:05:07.947236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.332697Z","title":null,"venue":null,"work_id":"494e37e0-1113-4f1b-a284-22769f8a95cb","year":2021},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.949555Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:ef25b54a5f5ea952539bc6a1a895d96c9eb7c4f9079e8204375fa02540bf9427","observation_id":"24d34e81-292b-4b9b-a2a1-bde4657ca6fe","resolution":{"observed_at":"2026-08-12T06:05:08.336479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.952697Z","title":"Deduplicating training data makes language models better, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.952697Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:b4fece6386739ca7dfcdf6deb6876c64bdd19cc6d238b7dc2c39804fed8dc09a","observation_id":"e68923b6-1424-4d9c-8caf-e05c60e9c522","resolution":{"observed_at":"2026-08-12T06:05:07.952697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T06:05:07.956000Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.956000Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:1fbac7bd119dfed542510e0b8941d09ad75d393d734396a07521f46097b55b2a","observation_id":"8c680084-a89c-4fa0-8f8f-53f2e7cb7175","resolution":{"observed_at":"2026-08-12T06:05:07.956000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.317369Z","title":null,"venue":null,"work_id":"008ee183-f812-407d-b679-17a93ff70504","year":2021},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.959228Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:00669718535cf492e181c9eae5f3c2d491da3213a5c8796bce3f2253598abee9","observation_id":"ff8519f1-c197-460b-80d4-63215d00cf48","resolution":{"observed_at":"2026-08-12T06:05:08.320668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.962427Z","title":"Bag of tricks for efficient text classification, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.962427Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:02c6ed39194a4c000c09cc45ee17df8bf08f238c13b01c0b34cae4d9a13ba052","observation_id":"3bf16235-6307-44fc-ac2f-b0afde3f4206","resolution":{"observed_at":"2026-08-12T06:05:07.962427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:07.966571Z","title":"Efficient estimation of word representations in vector space, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.966571Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:3e2f60d941a04a01d3e639c81286a89036e3391d405c756d6743ed91e81364fd","observation_id":"6eb42067-f19b-4c22-81e6-5a2a0dea83e5","resolution":{"observed_at":"2026-08-12T06:05:07.966571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.297226Z","title":"A review on offensive language detection","venue":null,"work_id":"dc6accbb-fb16-4deb-956a-3ce5c6894f25","year":2019},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.969819Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:f9b0eb550882982672f64489e86d6a165f9009fc7c70771912a23e7f938e91ba","observation_id":"cf61abb5-0a9f-4877-8834-8d4976c4fcf1","resolution":{"observed_at":"2026-08-12T06:05:08.300166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18314","last_updated":"2024-03-29T18:48:35Z","snapshot_observed_at":"2026-08-16T14:06:00.080731Z","submitted_at":"2024-03-27T07:34:44Z","title":"Chinese Offensive Language Detection:Current Status and Future Directions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18314","snapshot_observed_at":"2026-08-12T06:05:07.973075Z","title":"Chinese offensive language detection: Current status and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.973075Z"},"links":{"cited_paper":"/paper/2403.18314","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:1bbcf45b2680f7639a61415c5ed649677a9f4ca7152633a71b0f2deaf6f51d74","observation_id":"bf8d9ee8-b334-4633-a7d2-d368f79e427e","resolution":{"observed_at":"2026-08-12T06:05:07.973075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12472","last_updated":"2021-02-04T10:00:07Z","snapshot_observed_at":"2026-08-17T08:08:05.515387Z","submitted_at":"2020-10-23T15:14:14Z","title":"HateBERT: Retraining BERT for Abusive Language Detection in English","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.12472","snapshot_observed_at":"2026-08-12T06:05:07.976446Z","title":"Hatebert: Retraining bert for abusive language detection in english","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.976446Z"},"links":{"cited_paper":"/paper/2010.12472","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:6cadf71e80cd8a93cb4d9513940af88fd3ef392e5d3acfc22386f8fe79ae4ece","observation_id":"78e968bb-356d-4165-8923-8aa374b1450c","resolution":{"observed_at":"2026-08-12T06:05:07.976446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-08-16T17:13:42.482483Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-12T06:05:07.979712Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.979712Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:d6cac9aee8e6b98105ce035eaac4302ae36b15117c97aaa9f3d539174ada502b","observation_id":"efd35854-948f-4b97-b266-6e79287aacfe","resolution":{"observed_at":"2026-08-12T06:05:07.979712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06025","last_updated":"2022-10-19T07:59:03Z","snapshot_observed_at":"2026-08-16T17:28:04.954216Z","submitted_at":"2022-01-16T11:47:23Z","title":"COLD: A Benchmark for Chinese Offensive Language Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.06025","snapshot_observed_at":"2026-08-12T06:05:07.983285Z","title":"Cold: A benchmark for chinese offensive language detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.983285Z"},"links":{"cited_paper":"/paper/2201.06025","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:28cc2d03dbe0145dcd5c46f28de455fd5c89acf3f847391d79a031b1e07de2be","observation_id":"6c97ff2e-5d90-49a3-92ff-e0e2210ead4b","resolution":{"observed_at":"2026-08-12T06:05:07.983285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.288427Z","title":null,"venue":null,"work_id":"9fb42687-2445-4f53-9e03-7f394876aa7d","year":2024},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.986621Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:13535984a1c5ebb8d0e35a21435c92afa37b954fc191901b15a21b1cab7a0d4c","observation_id":"57475f31-d657-4df3-9c7a-b8cce2a6c0a3","resolution":{"observed_at":"2026-08-12T06:05:08.291069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.279009Z","title":null,"venue":null,"work_id":"385355ef-2ca9-412d-ab95-7892e643b129","year":null},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.989703Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:eabc28154c550711e01ccaa27b06b5d758f42456540d146d86257a40b79be7b4","observation_id":"4db47989-be99-411f-8b1a-55d34a541e74","resolution":{"observed_at":"2026-08-12T06:05:08.282117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03835","last_updated":"2022-05-21T14:28:44Z","snapshot_observed_at":"2026-08-16T17:03:42.833094Z","submitted_at":"2022-05-08T10:36:54Z","title":"On the Use of BERT for Automated Essay Scoring: Joint Learning of Multi-Scale Essay Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.03835","snapshot_observed_at":"2026-08-12T06:05:07.992754Z","title":"On the use of bert for automated essay scoring: Joint learning of multi-scale essay representation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.992754Z"},"links":{"cited_paper":"/paper/2205.03835","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:e065da458c4892e63f884a9b479ee2818965fe2bc5b0f077e7eb702a8c4c10b3","observation_id":"efc6a8c7-bee2-4be0-ad24-62a025357f79","resolution":{"observed_at":"2026-08-12T06:05:07.992754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T06:05:07.995961Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.995961Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:81b164721eaf151b8ac487a71901aa5aea8d31b1c2a7f0defc9bdb1ec64362cd","observation_id":"53f4457d-46c3-4951-88d4-d68409d5c484","resolution":{"observed_at":"2026-08-12T06:05:07.995961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.269265Z","title":"A neural local coherence model for text quality assessment","venue":null,"work_id":"14d436f5-5a09-4433-b4da-5fffd0700a4d","year":2018},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:07.999201Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:81cb98d090c3ee77bccb63fcd9815e1b8537c90e6e7987634cecacf78741cb31","observation_id":"64d48f70-c8c2-4b33-ba8b-7bc2691c48b9","resolution":{"observed_at":"2026-08-12T06:05:08.272891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.259755Z","title":"Temp: taxonomy expansion with dynamic margin loss through taxonomy-paths","venue":null,"work_id":"b5c628a6-3dab-476a-81c8-588ad1dcc7c7","year":2021},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.002028Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:f7772dd51bc62a44b5b0b00efb1c6f876cc1a9cfcfb5224c3bf1f057e91ea3bb","observation_id":"d4d7dcc7-d431-401b-ad81-883807d14450","resolution":{"observed_at":"2026-08-12T06:05:08.263142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.250050Z","title":"Probability of error of some adaptive pattern-recognition machines","venue":null,"work_id":"22e2320f-c78e-4c2d-a14f-f7883f90bf10","year":1965},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.004899Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:27d589c241401e65463d9ec6ecce8f1f51d75558dc90671a3ae0cd3f826b424d","observation_id":"4f97475e-3b6f-4c17-99ee-0e4086794bf8","resolution":{"observed_at":"2026-08-12T06:05:08.253499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.008042Z","title":"Uncertainty-aware self-training for few-shot text classification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.008042Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:d3c87b8276e9edab44bf66a49fb9bf2fd309ecd1a7d695dafc22fec36587ec35","observation_id":"447abf01-44b3-48ec-93db-6b6f5bb4bdf3","resolution":{"observed_at":"2026-08-12T06:05:08.008042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04446","last_updated":"2023-05-08T03:50:38Z","snapshot_observed_at":"2026-08-16T15:34:54.696929Z","submitted_at":"2023-05-08T03:50:38Z","title":"Facilitating Fine-grained Detection of Chinese Toxic Language: Hierarchical Taxonomy, Resources, and Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04446","snapshot_observed_at":"2026-08-12T06:05:08.010954Z","title":"Facilitating fine-grained detection of chinese toxic language: Hierarchical taxonomy, resources, and benchmarks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.010954Z"},"links":{"cited_paper":"/paper/2305.04446","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:6aae40b188c5cf8fa49e276d17529fb61b0a2cc0e96e1eb638ae3db2d612de32","observation_id":"b493f098-6b22-4079-aa93-f6b0e5736f5e","resolution":{"observed_at":"2026-08-12T06:05:08.010954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.234075Z","title":"Swsr: A chinese dataset and lexicon for online sexism detection","venue":null,"work_id":"24d66663-f886-4b05-b21d-423c6a93b264","year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.013668Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:1351bb54f2cdcdc9dc31f08ed1828045c858a6fa74a5ca630e4964901fb21fec","observation_id":"21e47696-be73-4028-9227-4682ff38c4d3","resolution":{"observed_at":"2026-08-12T06:05:08.237502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.224282Z","title":"Towards identifying social bias in dialog systems: Framework, dataset, and benchmark","venue":null,"work_id":"4fbc179e-8107-4e32-b65b-9d791915d240","year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.016115Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:a31cf8428a22046a0d1fa04e7577986b8ed41f1440cdcfdc2414f0d618cbf43b","observation_id":"e4bd2f25-a6dd-434f-affa-d36b9431ebd1","resolution":{"observed_at":"2026-08-12T06:05:08.227830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.018665Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.018665Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:2359839fecf2d60cb771372c66971f0e58dc61708b7cb04a9a30781d216079a1","observation_id":"71a726c7-efcd-4d6f-a5cf-0afe880dc253","resolution":{"observed_at":"2026-08-12T06:05:08.018665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.208404Z","title":"The bigscience roots corpus: A 1.6 tb composite multilingual dataset","venue":null,"work_id":"28fba2c3-cdf8-48b6-80bf-a38a430f056f","year":2022},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.021311Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:65fb9fe282fe419adc895b2376f19a2b792db8d3998cf8e165c22951e3e894e5","observation_id":"5639c668-5e6b-4466-b17d-9230b79d1943","resolution":{"observed_at":"2026-08-12T06:05:08.211890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08983","last_updated":"2019-04-27T02:05:15Z","snapshot_observed_at":"2026-08-14T16:59:47.914358Z","submitted_at":"2019-03-19T20:22:02Z","title":"SemEval-2019 Task 6: Identifying and Categorizing Offensive Language in Social Media (OffensEval)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08983","snapshot_observed_at":"2026-08-12T06:05:08.024914Z","title":"Semeval- 2019 task 6: Identifying and categorizing offensive language in social media (offenseval)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.024914Z"},"links":{"cited_paper":"/paper/1903.08983","citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:209a6dfa4e949c78acc57434380a3fe05a9b6b57f257db212e5620d50c432dc8","observation_id":"421018ca-bccf-4e0d-95a0-db603ab0b81b","resolution":{"observed_at":"2026-08-12T06:05:08.024914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.197071Z","title":"I feel offended, don’t be abusive! implicit/explicit messages in offensive and abusive language","venue":null,"work_id":"c8337ba6-dfaa-4cf6-9127-72f257e9e548","year":2020},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.027631Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:8395d5b4f857a0c824300dc99a59c445d5457e0653fd881de974c8e96f4dd2e7","observation_id":"e03a2642-539f-4b86-8c51-2270588cf96f","resolution":{"observed_at":"2026-08-12T06:05:08.201853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T06:05:08.186114Z","title":"True\" or","venue":null,"work_id":"35fc333d-a205-4a1b-9889-e95cda435a4b","year":2019},"citing_paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T06:05:08.031095Z"},"links":{"citing_paper":"/paper/2411.19668"},"observation_digest":"sha256:507515116035f8f26245eefbd3b1f4e55d46a8d731781bddb3d8de4e6c8fd4d3","observation_id":"ce6d4474-b071-4df9-a5d2-e11d8d453027","resolution":{"observed_at":"2026-08-12T06:05:08.190526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19668","last_updated":"2024-11-29T12:48:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T04:59:40.891456Z","submitted_at":"2024-11-29T12:48:49Z","title":"ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2411.19668."}