{"as_of":"2026-08-19T16:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5ce48040f8dd4a7cede7995ecfdb3be8b22e2d9729259273ba8b4f6b67b682a","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:46:42.222982Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04687/citation-record","integrity":"/paper/2507.04687/integrity","json":"/paper/2507.04687/citation-record.json","paper":"/paper/2507.04687"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:50.319601Z","title":"Elsevier, 2012","venue":null,"work_id":"b9fda18c-65fb-4df8-9343-20c8062015cc","year":2012},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.595953Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:07e8739de6470f39089cc9a44f1ce63231a72e047e65483f3507a0f5524b8353","observation_id":"337ca480-dd88-448e-ad72-76c62958689d","resolution":{"observed_at":"2026-08-06T19:46:50.409598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:50.121096Z","title":"Methods of integrating data to uncover genotype–phenotype interactions.Nature Reviews Genetics, 16(2):85–97, 2015","venue":null,"work_id":"b256f04a-9a19-4059-a08f-c8c4fef73931","year":2015},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.645559Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:58d7346f7e82585770822f43ec0f20c280300834265d23beebcb946e9c57fe62","observation_id":"9c51b48d-a157-4214-a5f8-8bbf29c691c8","resolution":{"observed_at":"2026-08-06T19:46:50.224581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.928308Z","title":"Efficient joinable table discovery in data lakes: A high-dimensional similarity-based approach","venue":null,"work_id":"46bbc41b-951d-484b-ae7b-7f2fa05d3a4f","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.720279Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:9f5d39d33d682a8af437b399d5805c3763432c880d3abdf5c405d0f3ad98c38b","observation_id":"96c9b145-c82f-402c-b884-162db2a85863","resolution":{"observed_at":"2026-08-06T19:46:50.026779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.734892Z","title":"Semantics-aware dataset discovery from data lakes with contextualized column-based representation learning.PVLDB, 2023","venue":null,"work_id":"6d6e9d06-80f4-4066-b525-a37c41a756ff","year":2023},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.782069Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:16e097fa67284da8c19cc4d18aceec0f4f944161cf111b709c5086a828394efc","observation_id":"650a923a-0509-4fd9-bea3-2f78ce0ed162","resolution":{"observed_at":"2026-08-06T19:46:49.824503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.556042Z","title":"Rosenthal","venue":null,"work_id":"e841038f-35f9-44d4-be60-34ad7bf95d21","year":2007},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.864316Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:a26408721574f6bcc7a5c268fdfc37ca686108584ab30b1521b72b23dbd686db","observation_id":"45a2b0e0-7a8f-4e77-b801-df5a0b27a8e6","resolution":{"observed_at":"2026-08-06T19:46:49.642134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.420882Z","title":"Valentine: Evaluating matching techniques for dataset discovery","venue":null,"work_id":"c92f3880-ea07-4de0-aa41-410d2e0579f8","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:38.933152Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:d2bd3763e8dd32331915fd2ea6c0fd5f89e35ecd521f2fcbba6844419073f76b","observation_id":"0780ed56-de8f-4da4-9afb-4bb7a1115e32","resolution":{"observed_at":"2026-08-06T19:46:49.482221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.222698Z","title":"Table union search on open data","venue":null,"work_id":"f87f0f03-13e7-4333-9011-9fa5d897d5a6","year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.022395Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:d8826cc346c1a26e84cd7cd09ce00a3ceb5944f6652b0b3af9ad94b09b2a77ed","observation_id":"75a00a98-a892-4963-b6b2-a20f06ed0068","resolution":{"observed_at":"2026-08-06T19:46:49.318760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07258","last_updated":"2023-04-12T13:24:55Z","snapshot_observed_at":"2026-08-16T18:17:23.529370Z","submitted_at":"2021-06-14T09:22:09Z","title":"GitTables: A Large-Scale Corpus of Relational Tables","version":5},"cited_work":{"arxiv_id":"2106.07258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.07258","snapshot_observed_at":"2026-08-06T19:46:42.796080Z","title":"GitTables: A Large-Scale Corpus of Relational Tables","venue":"cs.DB","work_id":"b5235787-2945-4704-81b6-cfdf6e0efec2","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.120703Z"},"links":{"cited_paper":"/paper/2106.07258","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:9533870d406126a7a85431e219fb03d5dc269a68c75a0135fb33958af4c20695","observation_id":"4b00f74a-ccce-422a-92a8-a565f510056b","resolution":{"observed_at":"2026-08-06T19:46:42.890225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:49.037802Z","title":"TPC-DI: The first industry benchmark for data integration","venue":null,"work_id":"86ce3b28-a55c-4788-86a0-5bf49e38ea4a","year":2014},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.173905Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:47ed014429265f24309b933ce42e9a58b957d6430d202a5d85abe5db92dc3a69","observation_id":"49028a64-ef2b-4a64-81c6-76178d7ec822","resolution":{"observed_at":"2026-08-06T19:46:49.125604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:39.236042Z","title":"Chembl: a large-scale bioactivity database for drug discovery.Nucleic acids research, 40(D1):D1100– D1107, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.236042Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:52ff3c52436dbea7e24a5089228783f4ac04cfefed9ef709b51aa8e0c22d5810","observation_id":"aa467c42-0294-4e0f-9812-9a1dd64662f1","resolution":{"observed_at":"2026-08-06T19:46:39.236042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.849407Z","title":"C., Chaitanya Gokhale, Pradap Konda, Yash Govind, and Derek Paulsen","venue":null,"work_id":"7f7e3e32-3e4a-4dee-b28e-cf38a48484f7","year":null},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.302163Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:dac6ddf6c9ee73f26f84935422b3b07fc5ff1cc636aefc464784173ddc68b538","observation_id":"57d2744d-e8c1-4849-8bb3-f85a1f0a8507","resolution":{"observed_at":"2026-08-06T19:46:48.946488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.656687Z","title":"Snomed-ct: The advanced terminology and coding system for ehealth","venue":null,"work_id":"66fd26f4-6317-47a2-b741-6422c8981504","year":2006},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.347667Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:5d62662160c40759e9665dba42fbf3d20e72d760b0ae61585d61742259a9aa00","observation_id":"d55a9d0a-c3eb-48cd-99ee-ff1a18c6e897","resolution":{"observed_at":"2026-08-06T19:46:48.741560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.501676Z","title":"The making of tpc-ds","venue":null,"work_id":"9c60dbd0-7c31-45fb-887f-c6a59434b6d6","year":2006},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.417269Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:7b81d6e86192d5f532c03d92e44a33aaae692c9084b0c2e5e5b5ec97d3926711","observation_id":"3f32be8b-2d3b-434d-a22f-56ae5e46e621","resolution":{"observed_at":"2026-08-06T19:46:48.565726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:39.501733Z","title":"Synthetic data generation for tabular health records: A systematic review.Neurocomputing, 493:28–45, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.501733Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:33f08dc48f1e5c5e914ba38b5a8edf2d996390db2b476b31b6fbff42bdce6450","observation_id":"cab24634-ef3c-4f1b-af7c-2b7941f4183d","resolution":{"observed_at":"2026-08-06T19:46:39.501733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.338044Z","title":"Language models are realistic tabular data generators, 2023","venue":null,"work_id":"892bb9c2-5c97-44f3-9100-528e5d71d30c","year":2023},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.567490Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:3c46abf4cba12199f2d264bca7068921e395d78924a68b4d40de2afa4d15c428","observation_id":"641e7c3f-cf91-40ce-9e35-47e36155955e","resolution":{"observed_at":"2026-08-06T19:46:48.419360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:48.151818Z","title":null,"venue":null,"work_id":"d7294938-7368-4a73-8f78-51b5c68fe30f","year":2019},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.649660Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:bc094b1a4a0d3c642c0cc81229494b641c20446a9aca7486a3edb40fc9ed33bc","observation_id":"e6c5ebb3-4060-4b71-8bc9-0bead5d7dbd7","resolution":{"observed_at":"2026-08-06T19:46:48.218891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.985060Z","title":"The financial industry business ontology: Best practice for big data.Journal of Banking Regulation, 14(3-4):255–268, 2013","venue":null,"work_id":"a118f811-4e65-4a64-bdf3-bc90622abc77","year":2013},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.706577Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:f7ce81b8f86e1191ff05253418cd3aaab4681313eae210f366dee5ca45cb6f30","observation_id":"bbf2f4fe-db4a-4f6a-8bfa-6ee40d839b7d","resolution":{"observed_at":"2026-08-06T19:46:48.056567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.850719Z","title":"A survey of approaches to automatic schema matching","venue":null,"work_id":"652247ff-d48e-4f79-94fb-dcdbb079246d","year":2001},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.787516Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:7736aa04cbb737e526bc89c52a74ad8775e214a4b337bbf89197feda6a024634","observation_id":"3746e272-56fa-44c5-91b6-39e8e2cc8d8c","resolution":{"observed_at":"2026-08-06T19:46:47.915906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.688625Z","title":"The gene ontology (go) database and informatics resource.Nucleic acids research, 32(suppl_1):D258–D261, 2004","venue":null,"work_id":"b7d159db-066f-45a9-b79b-84da8ccdb848","year":2004},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.851571Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:620427f48b975fbbc84146f762237d59c596b16855481453b65c84349353eeef","observation_id":"c3b24c92-6f06-4832-bd50-cdc621c64b63","resolution":{"observed_at":"2026-08-06T19:46:47.759516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.467460Z","title":"Building a drug ontology based on rxnorm and other sources.Journal of biomedical semantics, 4:1–9, 2013","venue":null,"work_id":"1fad5266-58bc-4c7d-acda-8a29187647fb","year":2013},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.914870Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:8fe6b26b723ed999855c255aafed763db75667f307e0ee9e32f49e3e87c2895b","observation_id":"6a2725aa-e419-4d1c-9893-1a1cc5c6e4b1","resolution":{"observed_at":"2026-08-06T19:46:47.570960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.336353Z","title":"Challenges and innovations in building a product knowledge graph","venue":null,"work_id":"47b5ed72-e739-4489-8ffe-f69195e50a2f","year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:39.999143Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:180f8f6235b30982734fb3997c4b4c40e3e57b7363b5b7bc14b0cde32e2f2e10","observation_id":"f999bc2d-c5f2-4b30-ace0-a05dc0ee35f7","resolution":{"observed_at":"2026-08-06T19:46:47.388707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:47.164113Z","title":"Owl web ontology language overview","venue":null,"work_id":"317e7742-1dfd-4c37-9afa-c5d232a906e2","year":2004},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.047649Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:68074192895fdb9b1ccb275c7d602e8299644cb77ab3884d8e13b5cd0fa16fc6","observation_id":"6fe9ace4-e603-44fd-bd99-a99abc0d0659","resolution":{"observed_at":"2026-08-06T19:46:47.252137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.998945Z","title":"Coma—a system for flexible combination of schema matching approaches","venue":null,"work_id":"47503631-ef1a-4afd-aa57-5dc964e99a82","year":2002},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.131147Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:e61e8c9f21f1a39d19677ca83c316614ee9d3e67bc8ee024e25a4d6071629f24","observation_id":"ff7ecb10-3b4c-4741-98a6-56ddb0b8c4b6","resolution":{"observed_at":"2026-08-06T19:46:47.074969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.839586Z","title":"Drugbank 5.0: a major update to the drugbank database for 2018.Nucleic acids research, 46(D1):D1074–D1082, 2018","venue":null,"work_id":"3127a1ee-b1ef-421b-9b83-5c34b2019496","year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.198143Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:925456373e676f3f275e6cd60ab9d5c6575db943003b2ef65d7b0a2203a8b500","observation_id":"9f71637e-76ab-4fd1-9856-24cf79e5e16b","resolution":{"observed_at":"2026-08-06T19:46:46.922457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:40.260786Z","title":"Mimic-iii, a freely accessible critical care database.Scientific data, 3(1):1–9, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.260786Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:1b46a2a9b923e41daeaa9ae92e22c5246fdda561452526ac2767ef3344460311","observation_id":"8d2683b9-ea0f-4fcb-b504-0d9c758d6816","resolution":{"observed_at":"2026-08-06T19:46:40.260786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.667707Z","title":"Mimic-iii clinical database demo (version 1.4).PhysioNet, 2019","venue":null,"work_id":"895ee5dc-b13b-4134-bb8e-ad0de51e833a","year":2019},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.312254Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:62839b7a6d0ab79577255cd27914a05dae41f92790be9a384686cbf064226e67","observation_id":"5aba2c4a-cfb2-4ec1-b8d9-62b5a329d36e","resolution":{"observed_at":"2026-08-06T19:46:46.747459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.398722Z","title":"Similarity flooding: A versatile graph matching algorithm and its application to schema matching","venue":null,"work_id":"99774700-e89b-4404-a092-83505c6b04f4","year":2002},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.364397Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:d5ff4ef54dbe431893335e1171e1e7a41f45f97ac1ab6dbf614584ed8de8147d","observation_id":"db218a45-5179-412e-8e43-f5bdfe4d1fb9","resolution":{"observed_at":"2026-08-06T19:46:46.536056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:46.154378Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":"98f26950-e45e-4498-b8b7-a2a102c33f09","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.443165Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:dcb5cea286309fe38bcb75a9d1276c2543fa76cca42dbb5314f526febb32aaa4","observation_id":"6eb207e2-0183-4765-9d70-05604111cba4","resolution":{"observed_at":"2026-08-06T19:46:46.268729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:45.994456Z","title":"Ad- versarial generation of natural language","venue":null,"work_id":"8eec3ba8-00c2-4bac-b333-100b354349a6","year":2017},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.509043Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:5657c3250ddb704f354295b7ad366f4facec20ef1e19baec7ac3b614b9935627","observation_id":"c1be3a87-1992-4882-a6a8-6074023d1fdc","resolution":{"observed_at":"2026-08-06T19:46:46.075543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:45.722981Z","title":"Stewart, and Jimeng Sun","venue":null,"work_id":"92332707-1248-46dc-8db5-fa552a76e560","year":2017},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.555798Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:f8988f8f1168ed7686097a8aadfdb1296297c2dd18398d7aae2cc4b3dbeeb5e8","observation_id":"aa1be799-bf5f-4ed6-b984-99d4d9f55ea0","resolution":{"observed_at":"2026-08-06T19:46:45.812879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:40.629325Z","title":"Data synthesis based on generative adversarial networks.Proceedings of the VLDB Endowment, 11(10):1071–1083, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.629325Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:c6e9b362f96e295c4561b37a074246dc8a562d6673dc1a72a5743e3b73da07d7","observation_id":"3a4faebc-9667-42fb-b7e8-39907213c57b","resolution":{"observed_at":"2026-08-06T19:46:40.629325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06657","last_updated":"2018-07-17T20:22:15Z","snapshot_observed_at":"2026-08-18T11:50:44.767574Z","submitted_at":"2018-07-17T20:22:15Z","title":"Airline Passenger Name Record Generation using Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":"1807.06657","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.06657","snapshot_observed_at":"2026-08-06T19:46:42.560533Z","title":"Airline Passenger Name Record Generation using Generative Adversarial Networks","venue":"cs.LG","work_id":"aa73e1b3-3d05-415b-a130-65fa0836780b","year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.634331Z"},"links":{"cited_paper":"/paper/1807.06657","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:418155e8220128fa14b47b201f4c9e2d92727eff656ffb98b525ef51da1b30d8","observation_id":"0c9ee4f6-e2b1-4572-8327-ec96a39e2b90","resolution":{"observed_at":"2026-08-06T19:46:42.682223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:45.444275Z","title":"Modeling tabular data using conditional gan","venue":null,"work_id":"d8656729-19cc-46db-b108-445b5e37f4d6","year":2019},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.731831Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:b516d26286c40636130d78dce03d6d07807f84151ed2b059269f38e4763e8c9b","observation_id":"dc61ac8a-6a39-4418-a8f4-01f5a28bd7f7","resolution":{"observed_at":"2026-08-06T19:46:45.574677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:45.140687Z","title":"Synthetic minority oversampling of vital statistics data with generative adversarial networks.Journal of the American Medical Informatics Association, 27(11):1667–1674, 2020","venue":null,"work_id":"12967b0b-b100-4ef6-a9c7-501142d24bfd","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.873680Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:d4577c9f2bc78684bbe7eb11db35dc29e2e8f035712f08179f4bf5f4433a04cd","observation_id":"eb18418f-f164-4d02-bd4a-92f87d94c7ce","resolution":{"observed_at":"2026-08-06T19:46:45.279523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:44.861079Z","title":"Vaem: a deep generative model for heterogeneous mixed type data","venue":null,"work_id":"3f080477-a2a3-41aa-8f2a-b7c2f2a31bd8","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:40.948983Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:ef585161a2f6907a13f94a59c33f9593ba7a904b70830f2ff1e88adff04f6884","observation_id":"5162ff48-412e-4edd-8619-984bcc90fe04","resolution":{"observed_at":"2026-08-06T19:46:44.978258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:44.572543Z","title":"Generating privacy-preserving synthetic tabular data using oblivious variational autoencoders","venue":null,"work_id":"ea1ea356-6f65-4a48-a475-c4dc55528198","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.037192Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:3196621ef6fa53d1c40cf5709b68c03890dd291f2887a5190e6f18177ef14761","observation_id":"59e88c8e-d7be-4997-a703-ffe9b8b2426c","resolution":{"observed_at":"2026-08-06T19:46:44.688347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:44.294807Z","title":"Synthesising multi-modal minority samples for tabular data,","venue":null,"work_id":"a18baf63-dbd0-4dec-ad42-0e281af3a087","year":null},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.164547Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:3f2c9e499dd03981091befcc552683b5fa093a9cfbf3a6b325071c35a6980576","observation_id":"3d7b0abf-0037-4df8-9ce5-3dac71e2ff5d","resolution":{"observed_at":"2026-08-06T19:46:44.418972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:44.103684Z","title":"Tabnet: Attentive interpretable tabular learning","venue":null,"work_id":"f03a53f6-7bda-4a78-a2d6-daef008f1fb6","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.388122Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:e3a1a031f5842c6adee7d8a236c7388c1926ee65da6041382b59f639ecc6c440","observation_id":"0553dfcb-ed37-4cfd-803e-29a2004ba0f2","resolution":{"observed_at":"2026-08-06T19:46:44.192549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:43.909047Z","title":"Saint: Improved neural networks for tabular data via row attention and contrastive pre-training,","venue":null,"work_id":"4116738c-5349-4041-a2e0-eec54db45eb4","year":null},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.503336Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:32d55482fccdccc84469846aadc4cd4d8eaa6e2750907feb9e63ee224b3aa05b","observation_id":"3f8d4c91-3f65-425b-a84f-7456084be414","resolution":{"observed_at":"2026-08-06T19:46:43.987059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:43.694077Z","title":"Self- attention between datapoints: Going beyond individual input-output pairs in deep learning","venue":null,"work_id":"e77ec49b-0c7c-4efa-8f08-30bb1730f817","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.747618Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:5364641ed498786f7b0ac0b0faebf4d9b23bdfd7362183bb5e39afceefa117de","observation_id":"ed4bfe12-dcd4-4a37-9b3c-771d0c154dab","resolution":{"observed_at":"2026-08-06T19:46:43.793904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01342","last_updated":"2021-06-02T17:51:05Z","snapshot_observed_at":"2026-08-16T18:20:11.383711Z","submitted_at":"2021-06-02T17:51:05Z","title":"SAINT: Improved Neural Networks for Tabular Data via Row Attention and Contrastive Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01342","snapshot_observed_at":"2026-08-06T19:46:41.626833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.626833Z"},"links":{"cited_paper":"/paper/2106.01342","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:af55db132055e832b27161965c7b0e98aba1745a8f5611500414f9dd86edeb7d","observation_id":"b79f17ec-2440-45e6-bdde-d000e72ff68a","resolution":{"observed_at":"2026-08-06T19:46:41.626833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:43.239112Z","title":"Tabular transformers for modeling multivariate time series","venue":null,"work_id":"a4ed8b4d-0c29-4682-a819-1b8fb4a50997","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.934788Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:a991beda40246f25d66479eb3c6bfcafa74093eedfb909f522fa3f850b3a7c72","observation_id":"03501243-0857-4756-bb5b-978a2b8eea4c","resolution":{"observed_at":"2026-08-06T19:46:43.344964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:43.465761Z","title":"Tabert: Pretraining for joint understanding of textual and tabular data","venue":null,"work_id":"1b377e0c-4206-4520-b217-d6093486263d","year":2020},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.835438Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:c5eb26bce831b456ed8514ffd3ba88bf54ec269abe1570c055ae146c4a184b0a","observation_id":"373ab5d0-63d0-4003-b11a-0b2983f2d634","resolution":{"observed_at":"2026-08-06T19:46:43.572886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06280","last_updated":"2023-04-22T10:03:23Z","snapshot_observed_at":"2026-08-16T16:24:48.218411Z","submitted_at":"2022-10-12T15:03:28Z","title":"Language Models are Realistic Tabular Data Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06280","snapshot_observed_at":"2026-08-06T19:46:42.138257Z","title":"Language models are realistic tabular data generators.arXiv preprint arXiv:2210.06280, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:42.138257Z"},"links":{"cited_paper":"/paper/2210.06280","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:08df03b62124166217e011dfddeec5a07ecd4a04aec912d8597ee07b17d5fa73","observation_id":"7f2db700-692b-483a-a5ee-f2ba72ec2510","resolution":{"observed_at":"2026-08-06T19:46:42.138257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T19:46:42.053276Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:42.053276Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:63ae4a026cd07f8069783be7f886d8751d337ca4684930ce2fabab9ecff01850","observation_id":"5325adc0-2019-45cd-8e1b-12da588388f8","resolution":{"observed_at":"2026-08-06T19:46:42.053276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:42.981802Z","title":"Listed Security","venue":null,"work_id":"b371f835-5eb3-4dd9-9cfc-542e63e6326e","year":2019},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:42.222982Z"},"links":{"citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:7718be9d13b2efced343057c91eb41e42202a528dfbfd278ee4faa99cfeb5e53","observation_id":"6e90b19b-322f-4a3b-9227-bdbe48f31031","resolution":{"observed_at":"2026-08-06T19:46:43.083215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08204","last_updated":"2021-05-17T23:54:08Z","snapshot_observed_at":"2026-08-16T20:58:33.072587Z","submitted_at":"2021-05-17T23:54:08Z","title":"Synthesising Multi-Modal Minority Samples for Tabular Data","version":1},"cited_work":{"arxiv_id":"2105.08204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.08204","snapshot_observed_at":"2026-08-06T19:46:42.386240Z","title":"Synthesising Multi-Modal Minority Samples for Tabular Data","venue":"cs.LG","work_id":"b58ed345-9501-46fa-a671-44fa85762b16","year":2021},"citing_paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:41.270318Z"},"links":{"cited_paper":"/paper/2105.08204","citing_paper":"/paper/2507.04687"},"observation_digest":"sha256:01167d0807c5fa948264ea0300e3198656d3a3d57d8f1cefa9bd4fcc2a39572c","observation_id":"de01cac0-a272-425e-937b-181ac35210a8","resolution":{"observed_at":"2026-08-06T19:46:42.437346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04687","last_updated":"2025-07-08T16:51:53Z","latest_version":2,"primary_category":"cs.DB","snapshot_observed_at":"2026-08-15T16:58:55.253311Z","submitted_at":"2025-07-07T06:08:45Z","title":"LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":3,"verified_fuzzy":36},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2507.04687."}