{"as_of":"2026-08-14T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:959a9b7751964da809259d99378de0c6e41ceee635bbbd1ae7f4f7dc4bd19f90","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:33:43.787531Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06524/citation-record","integrity":"/paper/2509.06524/integrity","json":"/paper/2509.06524/citation-record.json","paper":"/paper/2509.06524"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:38.928351Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:38.928351Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:7307715c37158f71d2440fb5a09792ab8a966d3c8d06d95dba34eb3fedfabf83","observation_id":"36611695-46bc-4fbd-84b8-32bb852895e0","resolution":{"observed_at":"2026-08-04T23:33:38.928351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T23:33:39.032615Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.032615Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:ab1f861fe361bc24c9048dd42c8860a4f9b059a2bff19c37a1098743858713f7","observation_id":"b8a1c987-f9d3-4830-97bd-5cac28f49bee","resolution":{"observed_at":"2026-08-04T23:33:39.032615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.846993Z","title":"Color-filter: Conditional loss reduction filtering for targeted language model pre-training","venue":null,"work_id":"6dcac167-9fa1-408d-bafd-49925a531f15","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.142597Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:1add1dabb35083cc51eb0be6a3803be0db834e1ed62d82e5c0a1e1bca013ebed","observation_id":"1f02c21e-0bd0-43f5-8ed4-61aa24933c99","resolution":{"observed_at":"2026-08-04T23:33:47.896802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:39.203281Z","title":"Statistical inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.203281Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:c1521530ca7c761241ff08b2722d0c371c240df19a2eb05e8f91882512184202","observation_id":"7f3a2181-16a7-4984-a9b9-c71cb163f229","resolution":{"observed_at":"2026-08-04T23:33:39.203281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09246","last_updated":"2023-05-16T07:52:57Z","snapshot_observed_at":"2026-08-13T11:41:53.693568Z","submitted_at":"2023-05-16T07:52:57Z","title":"Maybe Only 0.5% Data is Needed: A Preliminary Exploration of Low Training Data Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09246","snapshot_observed_at":"2026-08-04T23:33:39.307095Z","title":"Maybe only 0.5\\ arXiv preprint arXiv:2305.09246, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.307095Z"},"links":{"cited_paper":"/paper/2305.09246","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:6d2c6ad4efd5811a1aa8600782a4538b9eb74be85e97f79ac1450333636aa351","observation_id":"31f8ba62-0d74-4f2a-93fa-901086584fb9","resolution":{"observed_at":"2026-08-04T23:33:39.307095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:39.420873Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.420873Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:807d4c3b52958004846d195e52c795ab0dd2fd2e18c6a5735d1429a7efb3e369","observation_id":"d394646a-6661-4c17-8887-8e4894c4c885","resolution":{"observed_at":"2026-08-04T23:33:39.420873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T23:33:39.555558Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.555558Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:3475e6aae1d7f4552b299cb7ba5d27f3de61760c02f1173344c88208f23c4482","observation_id":"704d50ee-96cd-4719-aea2-56c47465eb94","resolution":{"observed_at":"2026-08-04T23:33:39.555558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T23:33:39.625275Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.625275Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:16d5a05ff0d04776130697cf51427540e770c1c7162f731e96709127e7796eaf","observation_id":"287cdd5e-d610-4783-8cf1-ef9e6da14912","resolution":{"observed_at":"2026-08-04T23:33:39.625275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.720155Z","title":"Sketchy moment matching: Toward fast and provable data selection for finetuning","venue":null,"work_id":"622e7d56-381e-4309-b713-0d15658695e0","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.744619Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:0d9141d6f0748792e6188fe9321322c022ba15792d8183b43ff6aa721b4bb0bd","observation_id":"2ce12f0a-0236-4e3e-919b-87c55dcfe2ae","resolution":{"observed_at":"2026-08-04T23:33:47.785803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.621841Z","title":"Dsdm: Model-aware dataset selection with datamodels","venue":null,"work_id":"794425ae-07c1-4e51-8742-178cd41206ab","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.805459Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:177e8d3e8e6818983ae41e7790b60175ef4c74f7c1e00a895603f8121b074960","observation_id":"14b74413-3450-492a-a832-84dcac04a4c6","resolution":{"observed_at":"2026-08-04T23:33:47.679914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.515885Z","title":"Dsdm: Model-aware dataset selection with datamodels","venue":null,"work_id":"0ccb3497-1b42-4148-980b-6ca89947a468","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.929141Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:185fc0e87117aaa9783a715375a0269205df9963f0d28e895f6b1a6e7ff34337","observation_id":"b41baaee-b249-45ce-80bb-435e46fd4c17","resolution":{"observed_at":"2026-08-04T23:33:47.552421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.333443Z","title":"Evans, Gordon B","venue":null,"work_id":"d42c8c71-a59c-4a44-979e-b0ef262a4a41","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.029161Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:3ce623cebc380ebe7db7c29e028a7d3fc3283d885af12f41b06cfdd1d14e7263","observation_id":"9e408eab-4345-4f8c-ba54-82c54f1b0b66","resolution":{"observed_at":"2026-08-04T23:33:47.419687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.230460Z","title":"GIO : Gradient information optimization for training dataset selection","venue":null,"work_id":"a8e8fdc3-ba2b-4960-93f5-25b7ae3ba48c","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.125862Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:b1e1d9f6b265ac8f86c2d25f51251f65819711a293b3ff7659914d5c5d27d51d","observation_id":"7768ed40-0b9f-49ac-a8a0-5c6e23406c02","resolution":{"observed_at":"2026-08-04T23:33:47.268358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-08-13T22:46:36.295191Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-04T23:33:40.212176Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.212176Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:d9015f04c96f3a4c023bd0ed2736a08c3f3da2e5a0279c850f64a965085684b1","observation_id":"76aea87e-84af-4f9d-90f8-6dbdca0f4488","resolution":{"observed_at":"2026-08-04T23:33:40.212176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.050129Z","title":"Data selection via optimal control for language models","venue":null,"work_id":"e7c2ceee-ae81-4e59-935b-a0ef0debc1ba","year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.321974Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:9282bc4e113e69e356731ba629bafeda21d254ac1ced8e72a2625182ff446094","observation_id":"cafc6fa2-8a3c-48f4-a098-066c6a9741c4","resolution":{"observed_at":"2026-08-04T23:33:47.145456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.941503Z","title":"SHED : Shapley-based automated dataset refinement for instruction fine-tuning","venue":null,"work_id":"b18216cb-d645-4cde-8b57-580d101363a1","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.435948Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:ccfe1a46c444730cfbf15e8e8e43053ea363ab985a08a1d38a9f24fff655e83c","observation_id":"46d76be7-5a67-48c0-98a5-fc5bab34c857","resolution":{"observed_at":"2026-08-04T23:33:47.000442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06708","last_updated":"2026-05-25T22:00:48Z","snapshot_observed_at":"2026-08-12T23:47:24.076762Z","submitted_at":"2025-01-12T04:28:14Z","title":"Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06708","snapshot_observed_at":"2026-08-04T23:33:40.574514Z","title":"Evaluating sample utility for data selection by mimicking model weights","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.574514Z"},"links":{"cited_paper":"/paper/2501.06708","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:1a66f5017c856489676d519bc48b6efe7792b6b9fd71bb4c6e9d14081e50d20c","observation_id":"f797b552-f111-48b8-87c1-5ee5e7140c79","resolution":{"observed_at":"2026-08-04T23:33:40.574514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.843302Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"87471e4f-30c1-4fe4-9484-a369b0390784","year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.678681Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:bc0f4d1a31643dc6d573b67093e734078423a2a9e4753a622304b17c1251728d","observation_id":"f75f2856-375b-4f60-9c50-be598e2a3354","resolution":{"observed_at":"2026-08-04T23:33:46.868735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-04T23:33:40.766727Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeff Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.766727Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:766e3b2fd5648133d3ec7e4c0a2aa2f3a57bb367d28e886b84bbe181420d8b55","observation_id":"b51f0d1c-0cd2-4268-b5a4-3e4c2f94796f","resolution":{"observed_at":"2026-08-04T23:33:40.766727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:40.848381Z","title":"Rule-based data selection for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.848381Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:af28c94d6759f6e79f0583747e79c9b238b439364b13666129d53fd60aaca130","observation_id":"64f03e7b-26a4-4318-a00c-338e4acd4453","resolution":{"observed_at":"2026-08-04T23:33:40.848381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.723887Z","title":"One shot learning as instruction data prospector for large language models","venue":null,"work_id":"6c050e42-9df0-460e-a131-5f91f60fdebe","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.963618Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:597216badbd0114fa5f748cd1fa373d4901c8f0a0f3d91cf4c97c1e87451ba87","observation_id":"e6b10f93-d954-4d7b-b8c1-9a101d5fd801","resolution":{"observed_at":"2026-08-04T23:33:46.794695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:41.043044Z","title":"D 2 LLM : Decomposed and distilled large language models for semantic search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.043044Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:dc13b833b22635c1b4305805c809ca5cf2909e1c053b24401cd42a782f940ae5","observation_id":"c561e07e-59f4-4c65-a8cd-535feab56a53","resolution":{"observed_at":"2026-08-04T23:33:41.043044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-04T23:33:41.158139Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.158139Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:e0211292fa254ad3df8a2d7f7f9e2a3655531a5ea95e1bfc0e534d26f6f9109a","observation_id":"bbd39cec-346f-458f-8e51-2b755225f82e","resolution":{"observed_at":"2026-08-04T23:33:41.158139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.570040Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning","venue":null,"work_id":"bd60fafb-efe9-4cb3-ba0d-f9ee14cc1741","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.278710Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:ed2020d229b1d6170b794e4a275ab81e5351b9e86de1d2c940eb2122d04c78ea","observation_id":"b9cfc409-4cc6-4d3b-be00-7e8eea0a4f66","resolution":{"observed_at":"2026-08-04T23:33:46.617318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14115","last_updated":"2025-02-24T07:59:00Z","snapshot_observed_at":"2026-08-12T23:38:35.854809Z","submitted_at":"2024-06-20T08:58:58Z","title":"Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.14115","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14115","snapshot_observed_at":"2026-08-04T23:33:44.202811Z","title":"Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models","venue":"cs.CL","work_id":"fa1d9155-a526-4114-8bf1-e5ce8529603d","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.391669Z"},"links":{"cited_paper":"/paper/2406.14115","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:36dab7f2548384a484382b3e67e2dd18f0b3e11ce185cf497e3d65ad63f9a019","observation_id":"033ccbfb-96c2-4282-93a0-05f3e839a323","resolution":{"observed_at":"2026-08-04T23:33:44.238868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.414289Z","title":"TSDS : Data selection for task-specific model finetuning","venue":null,"work_id":"4fcfbdb5-30a2-46fa-84f4-fc9c347943fd","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.467553Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:89c778c8403e2a99f9a46fa66b1d7f8c83c7d578a41cce74cf1c9145bfa50d13","observation_id":"0fab0a4b-2e75-415d-83e8-751c43aebed6","resolution":{"observed_at":"2026-08-04T23:33:46.481496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.288318Z","title":"When less is more: Investigating data pruning for pretraining llms at scale","venue":null,"work_id":"24a78b21-42bb-488d-9d76-88ce49855873","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.587282Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:cc1a940e491f19b2a7a4f2d495902af5dee1abff0d40a360d112c2da9efcfe2e","observation_id":"5af94284-6847-4d3b-a7ab-6e956edfb3e9","resolution":{"observed_at":"2026-08-04T23:33:46.335102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08904","last_updated":"2022-08-05T09:33:10Z","snapshot_observed_at":"2026-08-13T18:08:14.175481Z","submitted_at":"2022-02-17T21:35:56Z","title":"SGPT: GPT Sentence Embeddings for Semantic Search","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08904","snapshot_observed_at":"2026-08-04T23:33:41.675399Z","title":"Sgpt: Gpt sentence embeddings for semantic search","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.675399Z"},"links":{"cited_paper":"/paper/2202.08904","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:0c06486b1adf8f5d9dc93e669ae3cc42df9886f567248f1d9c787737f0ec1741","observation_id":"5e28398d-e475-4374-a303-2403924068b6","resolution":{"observed_at":"2026-08-04T23:33:41.675399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.103523Z","title":"Scaling data-constrained language models","venue":null,"work_id":"781ce706-b45a-4a16-9795-b37dc3a2fd44","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.773607Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:cdf8cf74ccdbb3d1a2652d221d754576f95f7809d279449ed0dd8965a81c157b","observation_id":"68f05c8d-a0b9-43a0-9d3e-a26c6679a32c","resolution":{"observed_at":"2026-08-04T23:33:46.156191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.931316Z","title":"Trak: Attributing model behavior at scale","venue":null,"work_id":"b8492bf2-fc64-4553-92ce-e74ab0444c60","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.873846Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:d34363bbaf3b401a0341d75aaf61ccbd18c7474c9a966dbda1b9043887561152","observation_id":"9631d39c-eeeb-4309-90f6-e80fb02a35b2","resolution":{"observed_at":"2026-08-04T23:33:46.032466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-08-12T22:28:05.465819Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-04T23:33:42.000535Z","title":"O1 replication journey: A strategic progress report - part 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.000535Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:9b98f5112bf7f3bfc783a09d845f42352a6628f73f3be435ee2bb37d23d09061","observation_id":"acc2dabf-d3ea-449f-9358-ffe2e6ef2a66","resolution":{"observed_at":"2026-08-04T23:33:42.000535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:42.093912Z","title":"Learning to retrieve prompts for in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.093912Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:b28848cbb2c5801cf1350aef1458c8b397c20cc2987f939041d6d110aef48e22","observation_id":"7f810919-8077-4187-bde1-1256f67ea180","resolution":{"observed_at":"2026-08-04T23:33:42.093912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-13T04:18:39.535968Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-04T23:33:42.206386Z","title":"McAuley, and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.206386Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:5de82298435789a67c8ccafb74d449bb5cc8e01cf540c10956ac2c473cf6b5f8","observation_id":"3a86b5a3-61a3-4750-a132-2cb73815b823","resolution":{"observed_at":"2026-08-04T23:33:42.206386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.11174","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.060102Z","title":"Improving dense retrieval models with llm augmented data for dataset search","venue":null,"work_id":"fb3ad18e-f189-4c1f-9f5d-90e7d05ddf5e","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.268814Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:3562402d3766ba69e8823a70b97106dea3f4a42fabbd910b61a42a1f2e6070e7","observation_id":"2796cf24-d707-4247-87ea-8d61144007e7","resolution":{"observed_at":"2026-08-04T23:33:44.112021Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.821544Z","title":"Improving pretraining data using perplexity correlations","venue":null,"work_id":"b78793d8-1257-4ddd-8ff8-1c886b1fec67","year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.396817Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:8add037e624a9f57864ca7a141fa938f61334f309cf79f27e17afaaaf31d273b","observation_id":"46a246d7-5e3a-422f-9a78-9df8a2838166","resolution":{"observed_at":"2026-08-04T23:33:45.862471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T23:33:42.513074Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.513074Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:9f48b6481ba3b7850fa0ff712add3203fab0a67158aa2e0336e2cb5d94cd1194","observation_id":"fa571434-966d-4901-b7b2-d3dd0024c090","resolution":{"observed_at":"2026-08-04T23:33:42.513074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.777","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do your code LLM s perform? empowering code instruction tuning with really good data","venue":null,"work_id":"0ba06968-9a6d-4095-97c4-9db204bb524c","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.576550Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:c7c0a0597074c638ad7824eb1c36aaaa2d4d1b5392c07f7502e09f1ee9f9917c","observation_id":"f0f48a32-4456-4e6a-b220-8ef69370507d","resolution":{"observed_at":"2026-08-04T23:33:45.737973Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.561269Z","title":"QuRating : Selecting high-quality data for training language models","venue":null,"work_id":"9485d7e1-3b27-4586-84da-6507548b4c60","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.689126Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:99a150af15533b17d11334be26869cff5ab8517e638b8efa56ee983b91ff76f7","observation_id":"4c1b800b-8ca5-4467-8ea0-988b5cf2a74d","resolution":{"observed_at":"2026-08-04T23:33:45.605862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.386660Z","title":"LESS : Selecting influential data for targeted instruction tuning","venue":null,"work_id":"906dc8fb-18cd-4f19-8eaa-9837ef139a5d","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.789506Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:a906d3d909b7703860ee1e3ad80017509e097a3b6e46b912b35f2fde276e1d13","observation_id":"cb22c5e6-6e93-49f8-998b-a50e84f659d8","resolution":{"observed_at":"2026-08-04T23:33:45.464921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.205311Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":"cde19ff6-31f9-47aa-8c13-c5f0b4ce7bcf","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.880975Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:95dee5de5bb20accbdb0f2242571ee1c57012cee3e31d519354689cdb0c95e88","observation_id":"d58a49f6-035b-4227-b3bd-5532c68c0beb","resolution":{"observed_at":"2026-08-04T23:33:45.284526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.031189Z","title":"Wizard LM : Empowering large pre-trained language models to follow complex instructions","venue":null,"work_id":"7cdf7847-2968-423a-b8ca-6bdfd03103b4","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.976695Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:18446bb37c36942b79600f13ae5adcf4dc92c4bf9906451d8141857415550fb9","observation_id":"f481929d-97f7-4e8b-9e38-5883038d6f20","resolution":{"observed_at":"2026-08-04T23:33:45.103528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.890952Z","title":"Diffusion models: A comprehensive survey of methods and applications","venue":null,"work_id":"b7244258-9d2e-4d51-9964-9e3335bcdfc6","year":2022},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.091247Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:7e01b4a4e1c7052fac10a6df147a61db1777c164670f26dbdcf99ed1175fc36f","observation_id":"46a96f41-d786-4306-8a1b-96158de5e3c9","resolution":{"observed_at":"2026-08-04T23:33:44.964591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-04T23:33:43.168667Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.168667Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:0c575d0276932bba2eb9724081e1fcf8bb55ff002a7d673ec0db6816431c534b","observation_id":"2a0ed0ab-e21f-40d8-a1c9-3fc0cb07deef","resolution":{"observed_at":"2026-08-04T23:33:43.168667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.785364Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models","venue":null,"work_id":"08a18ec8-af40-4750-bf32-b5a5890b501e","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.283879Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:8a227f79878dfc9e3d7532170951686c7d1cd709032d6755ab53bc977c1afd32","observation_id":"101acc96-721f-4334-ba95-5ca3454b2b14","resolution":{"observed_at":"2026-08-04T23:33:44.836188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-04T23:33:43.405092Z","title":"Siren's song in the ai ocean: a survey on hallucination in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.405092Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:a3bcc1a6422bb1182f21e72345aa88c652b060ab64f98450dbe2b5b0e7ad00e7","observation_id":"c9202663-b1d7-44aa-a5fc-987e70b7257a","resolution":{"observed_at":"2026-08-04T23:33:43.405092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.593556Z","title":"Beyond similarity: A gradient-based graph method for instruction tuning data selection","venue":null,"work_id":"254d6bfb-5aab-412c-97b4-46a555013993","year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.483174Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:431adab76b5145ee2fe16ede0ad0b70ca8789b6aacb8967fe83aea1b24319c62","observation_id":"c5e85840-c6e5-4cad-959e-3d8b7ab4e27a","resolution":{"observed_at":"2026-08-04T23:33:44.679324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14658","last_updated":"2025-01-07T05:37:04Z","snapshot_observed_at":"2026-08-13T04:12:47.707151Z","submitted_at":"2024-02-22T16:06:23Z","title":"OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14658","snapshot_observed_at":"2026-08-04T23:33:43.578607Z","title":"Opencodeinterpreter: Integrating code generation with execution and refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.578607Z"},"links":{"cited_paper":"/paper/2402.14658","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:3da77677a89ed7a256f04719819916efcf0f7079aea39592dac198d54ad000d8","observation_id":"d5965d9f-92de-4616-bf9d-b506567a1a1e","resolution":{"observed_at":"2026-08-04T23:33:43.578607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.475414Z","title":"LIMA : Less is more for alignment","venue":null,"work_id":"6c698d54-eaa2-4031-b511-0124ad119828","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.635829Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:62615383f1f360767d02ab62aa9946a1a0469d1be0c0707502fe1ef98412e4d8","observation_id":"f21446f6-c20a-4297-929b-296eea4bcc5a","resolution":{"observed_at":"2026-08-04T23:33:44.510160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:43.685397Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.685397Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:37b8fa398b6938be44f33e5c08e73cc3ab2d8cbf6ea06b4ab75aa74e958afe79","observation_id":"aa2630f7-9d58-403b-a007-d0b16e3eb506","resolution":{"observed_at":"2026-08-04T23:33:43.685397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:43.748037Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.748037Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:c3be14ca3467667fdb5b10725eabac03108c38d873e3db543634c9058ce15d52","observation_id":"973bf3af-5dd0-49ab-99f3-8b02a3d4ca37","resolution":{"observed_at":"2026-08-04T23:33:43.748037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:43.787531Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.787531Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:f6e8d000fcbee8ed92043eb600df52462a5c946fee85eac0f4b777438375c8b9","observation_id":"8358d436-b2da-4c60-8d74-37ec1cbb45bc","resolution":{"observed_at":"2026-08-04T23:33:43.787531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T04:13:03.096261Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2509.06524."}