{"as_of":"2026-08-10T11:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abcc263af93b406444f2b3ecfb634b6a55f3735ce6d4834d43d41df8cab3ac18","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:04.846398Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.14070/citation-record","integrity":"/paper/2505.14070/integrity","json":"/paper/2505.14070/citation-record.json","paper":"/paper/2505.14070"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.059812Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.059812Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:20549c9f3516384bf2dbb4783d1cb9c257f91c1f9512f544a9e45e8f10078a1b","observation_id":"a74eaf21-8783-473a-a6e8-20a611ea55b7","resolution":{"observed_at":"2026-08-07T15:42:59.059812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.290765Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.290765Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:e872d08108337ea81c836f9867c119c3b2878527fa1f539b0ae4f8deb918e655","observation_id":"de9173a3-8cf8-4534-a6d9-790eee4a79a2","resolution":{"observed_at":"2026-08-07T15:42:59.290765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:42:59.426510Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.426510Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:74bc70fb4c0224216ef76dede38ba88267ae2e3e5a7b56d5af827f47f561e9f5","observation_id":"dea282dd-61b9-44bb-9d6b-a41f143b230f","resolution":{"observed_at":"2026-08-07T15:42:59.426510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T15:42:59.545380Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.545380Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:7b2f5e952ce6a01d68313bf574f756c84c6f5ebcd899ac8549ab7a5a8049b370","observation_id":"dae8452d-0891-4b6e-8f99-e09d2dee3682","resolution":{"observed_at":"2026-08-07T15:42:59.545380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:12.141416Z","title":null,"venue":null,"work_id":"8b531288-77dd-4b75-a448-35c8f4f3bf77","year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.680870Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:e6ce64bddb85a7c8e37c305a4eade6d9fc64f2746ec48f3d4a03ffb8f83e31b0","observation_id":"0c904954-3672-488c-8344-c9647082f6e5","resolution":{"observed_at":"2026-08-07T15:43:12.215284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.748628Z","title":"D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.748628Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:95689079c4cda1ef9d79ff28eda155f77c7ccf2e2ba011198d957d45ac9ced12","observation_id":"e98dc18b-d567-41d8-bb92-b9358dc1bcf6","resolution":{"observed_at":"2026-08-07T15:42:59.748628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-07T15:42:59.855294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:59.855294Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:0225dc1dd0205a24999d6d72d801aeb3e32d1c105142eaee319bf81ef503a2b7","observation_id":"77d66440-fb24-4feb-971f-ed412cf8d90a","resolution":{"observed_at":"2026-08-07T15:42:59.855294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.002986Z","title":"W.; Sutton, C.; Gehrmann, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.002986Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:40fb94e328564b39ab7b3412740ad8126f93b56c838979af8c831e6485a32943","observation_id":"0c81c93e-7710-46ac-a2c9-d6889e74cde4","resolution":{"observed_at":"2026-08-07T15:43:00.002986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:11.914443Z","title":null,"venue":null,"work_id":"e6ade9d2-3c5c-488c-8495-d6cf26d1fecc","year":2019},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.117674Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:543dad6343ccc8e48c0e2c4a38b9731850f6edd90b731d03231ebc5e811ad376","observation_id":"4540a079-92af-4088-9db1-5f8ea201ac6a","resolution":{"observed_at":"2026-08-07T15:43:11.997009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.285708Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.285708Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:2224ca6d464f5192e3d71c72d21980146a645765d75bcf2b7512b0f9b050d537","observation_id":"7ce181cf-8469-4ae6-86d1-c9aa8b206eb1","resolution":{"observed_at":"2026-08-07T15:43:00.285708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:11.617993Z","title":null,"venue":null,"work_id":"dcbc5e8b-f3f5-48ba-a3f5-23920a2aafb2","year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.420056Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:204e1bc15f4f7aef334f518413a8b819ea0632c102b3d9b0fa378dec47d1a257","observation_id":"d2a2fbe9-e970-4ed8-9961-32edd9851b99","resolution":{"observed_at":"2026-08-07T15:43:11.720339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-07T15:43:00.461370Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.461370Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:23f2b083a323541715f1889bd6e479a2bcf646247fe6b755a85a7569cad66030","observation_id":"bdc2d005-aef0-40b1-9007-da1237be39e5","resolution":{"observed_at":"2026-08-07T15:43:00.461370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:43:00.538354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.538354Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:74a7cb1c89dcde1e65acc71950fd40cb0320b0ea7546e0c9f2e7960cbb427fa4","observation_id":"a3981686-3563-44c3-accf-e9815538bd1a","resolution":{"observed_at":"2026-08-07T15:43:00.538354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-08-10T11:00:33.114322Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-07T15:43:00.682538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.682538Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:88391435afa3fd022da93142d12b12641eb8a29de71527947b152f5f1efaf107","observation_id":"9cc5d988-5440-46bb-b397-31bf1a3acbb4","resolution":{"observed_at":"2026-08-07T15:43:00.682538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T15:43:00.756224Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.756224Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:29e9a988eca2c37f1c4b5f0d112f8ce0159a69117126175fc2c76c516dff0b56","observation_id":"4728e35d-6899-483a-af08-9db810c0debe","resolution":{"observed_at":"2026-08-07T15:43:00.756224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:11.378725Z","title":null,"venue":null,"work_id":"484924fb-033b-4fad-b9e3-22a930c1fee9","year":2001},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.831445Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:248a077c4410873f2afd4859e63d0c4a67c412bf9a2b6f79b9e087abf32ef784","observation_id":"3e1c8cc5-8555-41b8-8f23-9e301889eddd","resolution":{"observed_at":"2026-08-07T15:43:11.494761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:11.129588Z","title":null,"venue":null,"work_id":"46607399-3c6a-49b1-bb11-106476b4930c","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:00.916658Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d4d5d60396ab35641e84e797e67bb781f3681feebc04baeb1a315556d91a4a87","observation_id":"f4cff796-064c-4289-a458-672a1fd77947","resolution":{"observed_at":"2026-08-07T15:43:11.236160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:43:01.019419Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.019419Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:436b2db754ff3830952e26c84f9f2d51e18d4aebaf3f80cf3ceb901567915338","observation_id":"0014f397-4dfe-448c-afe4-32285fcf2226","resolution":{"observed_at":"2026-08-07T15:43:01.019419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T15:43:01.132790Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.132790Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:942b0c80fa527038e340bef89673fc0e3814a90437db24f3bd9fa34273dbbd28","observation_id":"6366c2eb-03db-4182-a53f-1a3780e10858","resolution":{"observed_at":"2026-08-07T15:43:01.132790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-07T15:43:01.256515Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.256515Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:8e684dbc5307d7f04967fc197d2303d653d23d411f75894f17c864c77f394ae7","observation_id":"a0f12529-6f58-4a8a-bca3-10fc5ef34ae8","resolution":{"observed_at":"2026-08-07T15:43:01.256515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-08T19:03:09.038168Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-07T15:43:01.352243Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.352243Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:1edc1e104e7005992a3619aceacbd34fd2caf416d984f044ccc377770fee9760","observation_id":"ad171979-523b-48c6-8f1b-e67f911f71c7","resolution":{"observed_at":"2026-08-07T15:43:01.352243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.837339Z","title":null,"venue":null,"work_id":"e0d2d288-7b0e-40b5-93fc-e6adab0983f1","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.500087Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:e7cbbc3a02801df447ebef3619bc424209af6030c9122ab9aeddafd9b50b10d1","observation_id":"91b152bf-6224-4149-8a0d-0fc2d15fe479","resolution":{"observed_at":"2026-08-07T15:43:10.995012Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.576076Z","title":null,"venue":null,"work_id":"b6cfdcb9-7615-47fe-a772-0d823364fc6e","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.607046Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:a6d09a5d51028da4dad850e33f9f36f97f86ef267876a0cc5cba8321bd498919","observation_id":"81555b22-d2fc-4a48-a3fa-5f781b8050de","resolution":{"observed_at":"2026-08-07T15:43:10.723342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.310090Z","title":null,"venue":null,"work_id":"4116fe46-8210-4aac-87c1-c78504160ad8","year":2019},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.738047Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:5db640b2c7f7623b59d6533e2a7f941ef1552952ba4b484011f67767e8ec85a3","observation_id":"bfae39f8-0608-4960-a784-faa81715624f","resolution":{"observed_at":"2026-08-07T15:43:10.415022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.082569Z","title":null,"venue":null,"work_id":"5fb28888-63e5-4e09-8d8a-1a541cc904f9","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.815206Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:22cfdb37cc9e7f060184b38c738d4e2252e21fd50f39336e111ace7bbb669f9b","observation_id":"297b779f-1dcb-42d1-b39f-67b71e41f16d","resolution":{"observed_at":"2026-08-07T15:43:10.172184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.892897Z","title":null,"venue":null,"work_id":"7f7b1cb5-5754-43b4-9779-7afa9c6274fc","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:01.975962Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:475709ee0eaab517a565705ba6aabe8fd86683204719d8dcf87c0cb4ba4077a6","observation_id":"7a59dfef-6315-4d5a-a97f-4e80db70ed38","resolution":{"observed_at":"2026-08-07T15:43:10.001649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-07T15:43:02.080560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.080560Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:233c905bb1c3e47bca3517e2866650c98d5808246dee66d452fa60e51925d5f3","observation_id":"06e5e715-c608-4eeb-9469-b882820327ce","resolution":{"observed_at":"2026-08-07T15:43:02.080560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-07T15:43:02.211420Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.211420Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:766627bbab385a68a75c3e4a87980ddc35fa301340126a63258172a1554eaa18","observation_id":"4aec75c2-ff56-486d-9e56-21d437597555","resolution":{"observed_at":"2026-08-07T15:43:02.211420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.710282Z","title":null,"venue":null,"work_id":"e949dfd4-3572-421a-a02a-f7f15b674fe8","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.306012Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:07aeda6d6fe416ed2e595a6e8b7471b3f2dd791236f6611757b4a7eb4f527018","observation_id":"41a7cba7-f4ab-45f2-87d5-26d903950700","resolution":{"observed_at":"2026-08-07T15:43:09.796495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06408","last_updated":"2024-06-20T18:21:49Z","snapshot_observed_at":"2026-08-10T08:40:39.251913Z","submitted_at":"2024-01-12T07:10:10Z","title":"AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters","version":3},"cited_work":{"arxiv_id":"2401.06408","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06408","snapshot_observed_at":"2026-08-07T15:43:04.992448Z","title":"AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters","venue":"cs.CL","work_id":"fee61869-2d67-463f-af3b-513e75727b07","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.460556Z"},"links":{"cited_paper":"/paper/2401.06408","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:11a0fad74d29d36311256b57212cee3392d25a6eb65df4520a0d05aefe02075f","observation_id":"6e26391d-6f50-4aec-9764-d2f88b2a4bde","resolution":{"observed_at":"2026-08-07T15:43:05.080971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-07T03:50:04.516601Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-07T15:43:02.614781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.614781Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:455d8116781799b4e9848eabec4c57d439a6a6956b65438106255559c142a13f","observation_id":"58768ad4-65f5-4480-8f5d-e1fd7c9863c9","resolution":{"observed_at":"2026-08-07T15:43:02.614781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.412492Z","title":null,"venue":null,"work_id":"7794aa13-3cf1-4aae-b69d-4e27a6c70624","year":2018},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.792246Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:9c3aad97fa8f57a6059e6af76510d74f3c91a0adc79ccecf6c0e0631feb0f2e1","observation_id":"eb659bc0-9077-41b0-a310-5596479d0995","resolution":{"observed_at":"2026-08-07T15:43:09.530889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.214745Z","title":null,"venue":null,"work_id":"5b800efa-e34b-47e2-8e81-38ec631e993e","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:02.876964Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:aa462ce846dfe98e0dd7bfc9d29f462b52a02f6ec4ca617f46368ffd8c5e90a7","observation_id":"b915ff41-63fb-4189-bfd1-7b0f4c7748dd","resolution":{"observed_at":"2026-08-07T15:43:09.282711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.981170Z","title":null,"venue":null,"work_id":"34ce2e75-e95d-4649-ac0c-9ff8769bf068","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.004907Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:fe4659eab66dfd8eef003eda30d44bab123d55e8200e9deee595914661a351e5","observation_id":"193edaf2-9d06-4bed-b305-31d943d7e611","resolution":{"observed_at":"2026-08-07T15:43:09.112489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.729370Z","title":null,"venue":null,"work_id":"91d80725-4b96-4d27-8fd3-a2438a2e95ad","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.085035Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:c94c2b27c7d463b2de7b64f98cf2a4e9ef338bb8f8abc4847c7cb71a3b1391ce","observation_id":"4e2c12da-88a6-441f-847b-bd1ecae9bc7d","resolution":{"observed_at":"2026-08-07T15:43:08.822452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.539745Z","title":null,"venue":null,"work_id":"8cd59fd1-e400-4790-8ff2-5a6c0fb28243","year":2010},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.150613Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d96b5c01ad058873812c3c0e18f62a8b5fab1297fa18f0527ee0a927657e6ad3","observation_id":"1c424ac0-1f8c-4648-be64-c83f4621142f","resolution":{"observed_at":"2026-08-07T15:43:08.634936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.300829Z","title":null,"venue":null,"work_id":"14059a5c-5cd6-46f3-9e7e-1dacd5adca37","year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.212731Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:d4c938166fc431493bf9c0a5611084ca925c142d15c311f44407d2888e213b1c","observation_id":"e122454f-aa2f-4508-bacf-0cbff24f8d7d","resolution":{"observed_at":"2026-08-07T15:43:08.436879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.068044Z","title":"T.; and Camacho-Collados, J","venue":null,"work_id":"9fcb4e83-93c1-49c4-95d8-095f9609b424","year":2019},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.347230Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:9dc3d84b52a51c6bf0cfde8808a440c37fbf94b4274c9f529f5068c81fff7758","observation_id":"ccc02604-daa4-4771-9356-f4847f30df9a","resolution":{"observed_at":"2026-08-07T15:43:08.187236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T15:43:03.405489Z","title":"W.; Borgeaud, S.; Cai, T.; Millican, K.; Hoffmann, J.; Song, F.; Aslanides, J.; Henderson, S.; Ring, R.; Young, S.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.405489Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:67e3201e80b9a512f9a83e532e1c20709b47152f019152e833b43ce0bc5c23b1","observation_id":"a402d614-35df-4bc9-bd58-86badd34f09b","resolution":{"observed_at":"2026-08-07T15:43:03.405489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.850033Z","title":"A.; and Gordon, A","venue":null,"work_id":"e6140ff7-291b-4f6e-a54f-2375e4fffa94","year":2011},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.477574Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:09aa39f21c483c3d3a1f66c923ed62269416c532f0c07eac8291881ab341b466","observation_id":"5cdb4bc1-0741-4833-b90a-533655951ecd","resolution":{"observed_at":"2026-08-07T15:43:07.988963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T15:43:03.600455Z","title":"H.; Caverlee, J.; McAuley, J.; and Cheng, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.600455Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:ba5b71ef8f6806a9eba32b46785a1d461dfa644d9637436f95b140b4530e6492","observation_id":"008d596f-f874-4fec-ae02-f2b8d97f73f7","resolution":{"observed_at":"2026-08-07T15:43:03.600455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.656708Z","title":"W.; Chowdhery, A.; Le, Q.; Chi, E.; Zhou, D.; et al","venue":null,"work_id":"92f3a7b4-8df5-4f3c-ae8f-a678bbfed073","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.767406Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:5b3102a492cd81ff08a9f6c5cdf7c0c2081024d88e374848afa240c10422267a","observation_id":"3e97874a-b70a-4fa2-9f89-bbf429272191","resolution":{"observed_at":"2026-08-07T15:43:07.764518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.414990Z","title":null,"venue":null,"work_id":"79ce490b-4be7-4013-b0a4-3159f341565f","year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.879265Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:eaa377b48e9a7c7968eb06a6aff1b1727a416f7dc46ff4b030d6d580823970cc","observation_id":"835b2ab2-bdc7-4468-a94a-5ff50653959f","resolution":{"observed_at":"2026-08-07T15:43:07.552561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:43:03.939326Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:03.939326Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:edcca5a0611b433225e240cea761f6455855a9d7a4b6d59d968fdebf085df7a7","observation_id":"6b002c33-edc9-45f8-98df-7a4127c0f0e1","resolution":{"observed_at":"2026-08-07T15:43:03.939326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.128457Z","title":null,"venue":null,"work_id":"9d3113de-1e98-4086-a986-2404c3c5b389","year":2018},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.028877Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:3e0b46b7c4aeada9600a26bf052055d0d3792d9f18ba4a26db5b124681010f5e","observation_id":"b6f99658-6016-4dcb-a565-fbf9526edc3e","resolution":{"observed_at":"2026-08-07T15:43:07.276440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-07-06T17:30:25.359458Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-07T15:43:04.140161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.140161Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:4997c8a5a77fdda6d78a4dcb3489f6bc0183ba039a6115485368359c8b811560","observation_id":"f315cbc0-8d87-4f8f-81a5-ed74cc1a313f","resolution":{"observed_at":"2026-08-07T15:43:04.140161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T15:43:04.219551Z","title":"L.; Fan, A.; Akiki, C.; Pavlick, E.; Ili \\'c , S.; Hesslow, D.; Castagn \\'e , R.; Luccioni, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.219551Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:a1108b4414f873488022b26891f56c28005f4b9301647b705682d525141223b8","observation_id":"e03e42be-eb94-4a0f-a1d5-07667bf31966","resolution":{"observed_at":"2026-08-07T15:43:04.219551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.881467Z","title":"M.; Pham, H.; Dong, X.; Du, N.; Liu, H.; Lu, Y.; Liang, P","venue":null,"work_id":"9dfde278-8a19-4196-bad0-0ca9a9d42ea0","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.308823Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:b39be179a956390d257d99caaba73a8004bb8efbd8ab8a4ba8256076cd7b605a","observation_id":"f4c74935-0855-4bba-9761-8db48bea8eb6","resolution":{"observed_at":"2026-08-07T15:43:06.975386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.556380Z","title":"M.; Santurkar, S.; Ma, T.; and Liang, P","venue":null,"work_id":"25745013-a755-487c-84d3-42023e8ee20e","year":2024},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.390396Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:942489575c8976e50be522948fe918bd41b57779faf3b6d4a9ed4016133761e0","observation_id":"bcbf2f87-91e2-4fee-9a76-472d9fc8aa1b","resolution":{"observed_at":"2026-08-07T15:43:06.714625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.255736Z","title":null,"venue":null,"work_id":"66c46f5a-c605-439b-a9a7-aa5edfa57979","year":2020},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.486167Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:3386ee5f510c348f2fed636ea123e089ef6bd9a477a74da1fd6b198eb38439f3","observation_id":"a81412d3-804a-4897-92df-a78aca3ed892","resolution":{"observed_at":"2026-08-07T15:43:06.340398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07498","last_updated":"2021-09-29T17:09:40Z","snapshot_observed_at":"2026-08-01T14:47:10.324996Z","submitted_at":"2021-07-15T17:51:25Z","title":"FewCLUE: A Chinese Few-shot Learning Evaluation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07498","snapshot_observed_at":"2026-08-07T15:43:04.560146Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.560146Z"},"links":{"cited_paper":"/paper/2107.07498","citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:876d39975d9abe31b38762db47dcb406bf493945a14271ad7d304283fa7fabe7","observation_id":"fe812265-7d11-49e3-b993-847d3e29acdc","resolution":{"observed_at":"2026-08-07T15:43:04.560146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.965351Z","title":null,"venue":null,"work_id":"3f2887f4-c22f-40c0-8ea5-87b7e8c53d1e","year":2021},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.679492Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:f36e32ef0fb2ef8c5e4ebf5609667ea26875947fbe03371ab0c723233be514a7","observation_id":"78ce1f43-17ac-4733-ba13-0b68cccbce71","resolution":{"observed_at":"2026-08-07T15:43:06.050140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.560706Z","title":null,"venue":null,"work_id":"2d2cb762-4e35-4dc4-ab79-bff99105f5c4","year":2022},"citing_paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:04.846398Z"},"links":{"citing_paper":"/paper/2505.14070"},"observation_digest":"sha256:4fa4171d8bab27e43c579c59ab50c89a79670e7e04aa35dadf508724c2dc3389","observation_id":"76c4d10a-decb-43f7-8cd0-48954d9eb888","resolution":{"observed_at":"2026-08-07T15:43:05.690013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14070","last_updated":"2025-05-31T03:47:36Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T03:52:59.052704Z","submitted_at":"2025-05-20T08:21:37Z","title":"Enhancing LLMs via High-Knowledge Data Selection"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.14070."}