{"as_of":"2026-08-10T16:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6a19742ad44c9afb745b3eb94d756aa6e658191eade3021252e16c09ed137d9","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:18:56.509967Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13892/citation-record","integrity":"/paper/2507.13892/integrity","json":"/paper/2507.13892/citation-record.json","paper":"/paper/2507.13892"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s13222-021-00399-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Four Generations in Data Engineering for Data Science","venue":"Datenbank-Spektrum","work_id":"498b0e25-a899-4044-a66b-ce73ccc6a40b","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:41.756013Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:3f380fb8c1b0ec1483cd2df092cab917967b04881d469e3d808ba1c2b4403a05","observation_id":"40c34b85-378e-48a1-8bad-d04fcb325c01","resolution":{"observed_at":"2026-08-06T16:19:03.512947Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5334/dsj-2015-002","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"The Challenges of Data Quality and Data Quality Assessment in the Big Data Era","venue":"Data Science Journal","work_id":"e36085f1-3672-473f-b7cb-e3058dfa56ed","year":2015},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:41.867224Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:bf4f157a181dc0571b515e00101ae4cfc9b7743ec09cf4cf9d1f0bb1659e3bfc","observation_id":"94a77ea5-d14d-4680-824a-b6af53a10d4c","resolution":{"observed_at":"2026-08-06T16:19:03.152860Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.025709Z","title":"GouDa - generation of universal data sets: improving analysis and evaluation of data preparation pipelines","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.025709Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:ec7142306c7a1557706ce6caec36f40183fd27d8de777fd59c658269406b5931","observation_id":"0756e37d-8d62-40a0-8369-dee0f354f00b","resolution":{"observed_at":"2026-08-06T16:18:42.025709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3310205","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Ilyas and Xu Chu","venue":"ACM eBooks","work_id":"ca0d2e29-8c62-43bc-8fca-e6ad2dd1978f","year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.173188Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:44388406b28b95d513c3ebe338a53c1c4c23c3335b4a2846838e49a15f5112c0","observation_id":"be4d4c17-5977-4445-915e-d37714b117ea","resolution":{"observed_at":"2026-08-06T16:19:02.825032Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5220/0010517301650175","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"DERM: A reference model for data engineering","venue":null,"work_id":"0ff38fb5-02e2-4a30-9023-50ab2696abfc","year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.318708Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:fc77f9467f2b595ffd653060b0dd0975eb90f2f74e5dcea48a11b8f3904c9be7","observation_id":"3864a190-32f4-4cae-a87a-5f0e1ae565d3","resolution":{"observed_at":"2026-08-06T16:19:02.504718Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.435103Z","title":"A Survey of Big Data Pipeline Orchestration Tools from the Perspective of the DataCloud Project","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.435103Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c6e6cefd5f1f39112de7fa5834ef8668bbf504ca38f57b154833985e05f3cd41","observation_id":"5b8ace07-6085-4c52-bf0f-a0d79c3390ca","resolution":{"observed_at":"2026-08-06T16:18:42.435103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.546386Z","title":"Self-Awareness as a Prerequisite for Self-Adaptivity in Computing Systems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.546386Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:ae0eca597fba62c76d3f8a658a8c7f27d78e8f7c3dfd4c8a975c57a120620d49","observation_id":"cfe8edf3-12ac-4cdd-b125-85df3db5a476","resolution":{"observed_at":"2026-08-06T16:18:42.546386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.645354Z","title":"Data Processing Pipeline for Eye-Tracking Analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.645354Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c35f570ee3926e9659fb2e5a29cb43aee900642b60a2e8881b68c331d967d3c5","observation_id":"ed754591-e80a-4aa4-ba26-197b39bc76a2","resolution":{"observed_at":"2026-08-06T16:18:42.645354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s40537-022-00613-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A unified representation and transformation of multi-model data using category theory","venue":"Journal Of Big Data","work_id":"7ec1ddf0-9f7d-4ddf-a029-24654e2ba8f9","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.744569Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:5d9ef2438f94a11f0b8ff66cd718bf789bb6e735858c09ab64af1c99853f3c57","observation_id":"18411631-4674-4216-94fd-20836d84c79a","resolution":{"observed_at":"2026-08-06T16:19:02.140214Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-59065-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Data Engineering for Data Science: Two Sides of the Same Coin","venue":"Lecture notes in computer science","work_id":"801ec08f-fbf4-41b3-b739-bc497bdd4d21","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.817650Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:a44c054a9f1ba9a6e68cc0287c6152ad7d2fc6b32a41d5aefe0b007aee1a7609","observation_id":"03427adb-de7d-4690-9928-e8d832e0ab27","resolution":{"observed_at":"2026-08-06T16:19:01.880923Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:42.923905Z","title":"The Art and Practice of Data Science Pipelines: A Comprehensive Study of Data Science Pipelines In Theory, In-The-Small, and In-The-Large","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:42.923905Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:7ea626e27a74eb22f064c05015db7264ff5727d65c4454be7221d43926988839","observation_id":"35cbfb20-48f1-4cf2-a1d5-a70eb1286c15","resolution":{"observed_at":"2026-08-06T16:18:42.923905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:43.034773Z","title":"What About the Data? A Mapping Study on Data Engineering for AI Systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.034773Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:8ee854b9d4fb9b1cf0b51088ff2bbc80638b6ef8a101845d85bb655747958ed3","observation_id":"1133a35d-b3c8-4d56-876d-772f4b8247c7","resolution":{"observed_at":"2026-08-06T16:18:43.034773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:13.928120Z","title":"NIST Big Data Interoperability Framework: Volume 1, Definitions","venue":null,"work_id":"a97e1cae-e5a8-4739-b218-708fcf1ca5c2","year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.105873Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:8212250748dc6e37a0a359a65fab7953d2254e87722d138e72667a5eec738cf6","observation_id":"22544497-827b-4451-973d-86389909c620","resolution":{"observed_at":"2026-08-06T16:19:14.102889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5220/0007748803510358","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Challenging Big Data Engineering: Positioning of Current and Future Development","venue":null,"work_id":"ead69a09-e7f0-4752-9ae0-6af6ed439478","year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.181397Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:9a1a66a21065ba152c99d76cbcf3f8016df0ab40b45922109ce859b03f1ce868","observation_id":"5cb83274-5eb8-4ccb-b7a7-67cb84b7eaf6","resolution":{"observed_at":"2026-08-06T16:19:01.614329Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3012429","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Atkinson, Michelle Galea, Tan Fong Ang, Paul Martin, and Jano I","venue":"ACM Computing Surveys","work_id":"0a19e17a-060f-4fe4-bb01-9dd0679d116c","year":2017},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.321961Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:454eb1d5936cbe7937a57779f8550a9fdeaba0ea6cd9d734f566f1b8c2128462","observation_id":"f8181db7-1c87-4bf4-ade5-b1612e73ccd8","resolution":{"observed_at":"2026-08-06T16:19:01.390862Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3470918","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Mahadi Hassan, Micah J","venue":"ACM Computing Surveys","work_id":"ff98a686-1906-4988-b8b1-08acae82713a","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.431857Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c1741c7a4e8367aa10b2e34aed9e1b5b882c455e91eb2e878405a6449a990d4d","observation_id":"2284ebe6-6d11-42f9-8c80-0430df611a18","resolution":{"observed_at":"2026-08-06T16:19:01.143652Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:43.534296Z","title":"Parameswaran","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.534296Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c027ebca09181c0acc13a13b8bd6ff704de4d33cea155dbf55fb6d10077de722","observation_id":"03340358-19f9-4b9d-aa6c-fbd902eae405","resolution":{"observed_at":"2026-08-06T16:18:43.534296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.01299","last_updated":"2017-11-03T18:50:08Z","snapshot_observed_at":"2026-07-31T01:57:34.961257Z","submitted_at":"2017-11-03T18:50:08Z","title":"BoostClean: Automated Error Detection and Repair for Machine Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.01299","snapshot_observed_at":"2026-08-06T16:18:43.667369Z","title":"Franklin, Ken Goldberg, and Eugene Wu","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.667369Z"},"links":{"cited_paper":"/paper/1711.01299","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:dfbee90e316083812684cb6cd5d2b25ae96d12bb46c65d72922f08e372a31291","observation_id":"7eada81a-f551-4013-8b0e-9237d1cbb8d8","resolution":{"observed_at":"2026-08-06T16:18:43.667369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:43.831195Z","title":"Ilyas, and Christopher R \\' e","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:43.831195Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c51738e53d8b7457a811c2fe60922bea166fa9080d785d01b5f1d293d39b185c","observation_id":"dc47e29c-8163-4f83-94c6-cdc3ea9b55fd","resolution":{"observed_at":"2026-08-06T16:18:43.831195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:13.534668Z","title":"Baran: Effective Error Correction via a Unified Context Representation and Transfer Learning","venue":null,"work_id":"2563d7e1-30d4-45d0-8344-82762f995f1f","year":1948},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.007682Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:1222890f407f3c56bc5a3b067132bf0e45ae63148d052db5be518e476ff12487","observation_id":"30579814-a446-4425-8d80-726231629518","resolution":{"observed_at":"2026-08-06T16:19:13.712610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:44.119150Z","title":"Ilyas, Mourad Ouzzani, Paolo Papotti, Nan Tang, and Yin Ye","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.119150Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:0052952da189b2a2b3882fb591d2f6b789d2352fc7555aaa0f5b7895d389c2c1","observation_id":"dbb3a155-d975-466f-8cdd-ef592cbb0c9b","resolution":{"observed_at":"2026-08-06T16:18:44.119150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4831.34448","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:08.760594Z","title":"Data Preparation: A Survey of Commercial Tools","venue":null,"work_id":"3740f896-54aa-46ea-acac-ec699551be15","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.222813Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:802c74307f96a69482d3be0ab0f46e196afe9363466c1794ef16a1c472f15095","observation_id":"e010e491-a227-4679-be6e-4d6fafaed3f3","resolution":{"observed_at":"2026-08-06T16:19:08.846105Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:44.367791Z","title":"Ilyas, Mourad Ouzzani, Paolo Papotti, Michael Stonebraker, and Nan Tang","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.367791Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:8a89953117a7e98fe334735a10708c75f19d675d8b830a5a822460925714d24e","observation_id":"9c392eb5-99bb-4c59-8074-255c977f6666","resolution":{"observed_at":"2026-08-06T16:18:44.367791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:44.474675Z","title":"SAGA: A Scalable Framework for Optimizing Data Cleaning Pipelines for Machine Learning Applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.474675Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:b5673e2901a84869bd2e219b12a64f3135d8dd0b9233086fe6e280c614c804d8","observation_id":"ab76c142-cba3-4f79-add8-72450a41f533","resolution":{"observed_at":"2026-08-06T16:18:44.474675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:13.175483Z","title":"Lindstaedt, Arnab Phani, Benjamin Rath, Berthold Reinwald, Shafaq Siddiqui, and Sebastian Benjamin Wrede","venue":null,"work_id":"a4f10dd9-a892-4cc8-ae03-cbab9bb54687","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.586308Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:443818b7df54ec53ca49c95456935b24f775c32c5ea46b3c35fa115682f6979c","observation_id":"a6f41fb7-33f8-488d-b408-360c9512adf7","resolution":{"observed_at":"2026-08-06T16:19:13.321832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:12.840499Z","title":"From Cleaning before ML to Cleaning for ML","venue":null,"work_id":"fc31b095-6343-407e-8e75-403b264b60a9","year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.737629Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:16dab889958bc8f6e942a78e5e2d5a808d8a08cccd81cfffb9e2979139684697","observation_id":"067fa20d-4423-4ef7-bc5f-f58ef4e9cec0","resolution":{"observed_at":"2026-08-06T16:19:12.996169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:44.845270Z","title":"Paritosh, and Lora Aroyo","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.845270Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:b7cb17d5ada7e0b9b1d37e47038cc54f20a65ee1646d242bf252bf08a169bd52","observation_id":"ce0a72c7-5028-492a-91b2-fb02eedfdb1f","resolution":{"observed_at":"2026-08-06T16:18:44.845270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1993.34401","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:08.173367Z","title":"Wang, Henry B","venue":null,"work_id":"770173c7-5a1d-416c-b942-8d6ddfb69126","year":1993},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:44.928450Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:e1ee1266e8c17147b5ea8d13d2dc59be1dbf3714cb24a10249f3bc28e2b4bf5b","observation_id":"af20534e-0d0c-466f-bf0a-71abb1bf04e2","resolution":{"observed_at":"2026-08-06T16:19:08.318269Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/69.404034","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Wang, Veda C","venue":"IEEE Transactions on Knowledge and Data Engineering","work_id":"cb9c17c1-087d-457e-9256-b5e8dd839052","year":1995},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.106545Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:bcb2297847efd37f06b596bf1feed45baeba445afe02d0a86dded69c498c596d","observation_id":"ee335dc4-6420-4461-b28f-524d6137efeb","resolution":{"observed_at":"2026-08-06T16:19:00.879937Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1879.18918","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:07.767990Z","title":"Blake and Paul Mangiameli","venue":null,"work_id":"3b571cc2-377b-4e0b-b2e1-1207940f53ab","year":2011},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.202506Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:0242cbd3505197563346879d3bb37b24e49305f10a77aa87f04b9ae26d85d9fd","observation_id":"2cf102f1-7455-4173-a785-4a4da8951840","resolution":{"observed_at":"2026-08-06T16:19:07.875397Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3148238","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Requirements for Data Quality Metrics","venue":"Journal of Data and Information Quality","work_id":"781c0731-9c0b-45d5-a3d7-3d624a2a0c5e","year":2018},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.270701Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:9d0cdb0c5854049cc3370302ec4f7f4fb39b800118da5773556787362c83ee25","observation_id":"8c2b710f-3c43-41bd-b7de-ff9297953421","resolution":{"observed_at":"2026-08-06T16:19:00.568298Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:45.364895Z","title":"Automating Large-Scale Data Quality Verification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.364895Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:5ab2f5c16b138a29dee3a4b22535c5c116dff4a4218d6eb65abf04ae192ae9b5","observation_id":"1c881a64-4387-492c-8771-78050bee9a7d","resolution":{"observed_at":"2026-08-06T16:18:45.364895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/bdcc6040153","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"An Advanced Big Data Quality Framework Based on Weighted Metrics","venue":"Big Data and Cognitive Computing","work_id":"374d5d5c-49a8-476a-ad67-997fa0e5b43d","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.444627Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:287b5b3906391329f804f96f5c8fbffccfca6a24a9cc3b0fa6c4a817358d4036","observation_id":"c264d572-5459-4d5d-aebd-bc8ea426cd29","resolution":{"observed_at":"2026-08-06T16:19:00.211483Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:45.596320Z","title":"Ilyas, and Theodoros Rekatsinas","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.596320Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:cc64d575833b5df05aca851146f1329e70426020f6087d723796d5cbf17fed3b","observation_id":"276110cb-0a34-48e8-b365-d94ad012795e","resolution":{"observed_at":"2026-08-06T16:18:45.596320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:45.733770Z","title":"Raha: A Configuration-Free Error Detection System","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.733770Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:4411c4bf4084693fec6588e498999de9de32c6c39eb1250ad3b43c7332ba4c71","observation_id":"c1250404-282d-4db8-beaf-d2052589f7c1","resolution":{"observed_at":"2026-08-06T16:18:45.733770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3589280","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Exploratory Training: When Annonators Learn About Data","venue":"Proceedings of the ACM on Management of Data","work_id":"3cd1ce57-1398-476a-88e3-c58a9a6a5452","year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.839458Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:01d726f0a37fc498fb6cbc18cb7fe645ab9adf6e7636f0f6c8a140edaeec2cd6","observation_id":"ed1b85c4-e91a-4df4-ba91-78d2f8c40ed1","resolution":{"observed_at":"2026-08-06T16:18:59.857478Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3190578","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Visual Interactive Creation, Customization, and Analysis of Data Quality Metrics","venue":"Journal of Data and Information Quality","work_id":"8cc59e11-ecd7-4424-b8e8-f6c50f4c61ff","year":2018},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:45.999251Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:d8d32766198b3ac33252579c162e12329cf123712a55cfd5b4d067f15cd08b4b","observation_id":"68c935bb-21fc-4e92-a166-7089ba633af7","resolution":{"observed_at":"2026-08-06T16:18:59.519113Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:46.128170Z","title":"o rl. FAIR is not enough - A Metrics Framework to ensure Data Quality through Data Preparation . In BTW , volume P-331 of LNI , pages 917--929. Gesellschaft f \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.128170Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:901d1605ca9fb7deb0baf04bdccd0e4c01c3592b5109870dde8cd4bd06b5d10d","observation_id":"ebfbc258-4623-433f-b239-b96d8e04db31","resolution":{"observed_at":"2026-08-06T16:18:46.128170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18420/btw2025-70","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"a mper, Ralf Diestelk \\","venue":"Gesellschaft für Informatik (GI)","work_id":"424ef63c-de6a-4803-8a27-3b474643bac9","year":2025},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.253498Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:92d2cfbc31eefe8be5bd607fa55e9b10babb1a57d4a237760c602cddd6838b2d","observation_id":"ec7c24bb-e746-472b-9ed1-f1cd15e44842","resolution":{"observed_at":"2026-08-06T16:18:59.122839Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-16462-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"noWorkflow: Capturing and Analyzing Provenance of Scripts","venue":"Lecture notes in computer science","work_id":"12cc8b06-606d-49ff-8ebe-47531c6e757f","year":2014},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.368926Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:e29868cc0816bcfa397b72417838e000b327106ade9f466fd513bfe18bab30c5","observation_id":"428eb458-3442-4c21-8bb9-2c47c38a6302","resolution":{"observed_at":"2026-08-06T16:18:58.742743Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6905.34369","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:07.030231Z","title":"Capturing and querying fine-grained provenance of preprocessing pipelines in data science","venue":null,"work_id":"08799701-785d-472f-9785-e9586352ab90","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.515199Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:54e05c0f50453edc592fe7c7d25fc4ec692d97be5dcded5bd739428028ba85e0","observation_id":"36dd8162-afe2-4d83-9672-766d80b8b989","resolution":{"observed_at":"2026-08-06T16:19:07.197632Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:46.660215Z","title":"Data distribution debugging in machine learning pipelines","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.660215Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:81d5c49c033c4eb1adcda96d16920002091a2d9cd26d997497a7a94279011de6","observation_id":"368701ce-cc81-4492-a63c-22e5cd2310ca","resolution":{"observed_at":"2026-08-06T16:18:46.660215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:46.764359Z","title":"Fair preprocessing: towards understanding compositional fairness of data transformers in machine learning pipeline","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.764359Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c9a417f8d88395171090b6fc7ac617778098e8ccb5651e42998e03a588b59b20","observation_id":"cdfcaff6-c6d0-4f25-9108-5fda5092d033","resolution":{"observed_at":"2026-08-06T16:18:46.764359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:46.899502Z","title":"Towards Explaining the Effects of Data Preprocessing on Machine Learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:46.899502Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:2e4f3d64419b97d0aa67eef688f82237928175f253cfaf50a032374cb6af39ec","observation_id":"079e99aa-4eec-4b8f-b5d6-63e9fdd0b989","resolution":{"observed_at":"2026-08-06T16:18:46.899502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.046949Z","title":"Dead or Alive: Continuous Data Profiling for Interactive Data Science","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.046949Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:0d2eea8990d5b1672dbbc9fc7bcd0a86797d2aac504e701c3fc59c707892b788","observation_id":"013d21c9-b9f5-41b2-a139-7dadde31483a","resolution":{"observed_at":"2026-08-06T16:18:47.046949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.151185Z","title":"Data Profiling","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.151185Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:43762420c687f5043fa9d9e067f2291ecf5ae23406f39e00d29d0345e43fbb9c","observation_id":"e4df4c95-783c-49fa-a5d6-dfd6913d886a","resolution":{"observed_at":"2026-08-06T16:18:47.151185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.424147Z","title":"Auto-Validate by-History: Auto-Program Data Quality Constraints to Validate Recurring Data Pipelines","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.424147Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:f8b785ec2276b14d3ec4650e308080d03d9afcbc572a042e417bc24aa4594070","observation_id":"3436a317-46ec-4dcd-9f7e-9b2402f0c8fa","resolution":{"observed_at":"2026-08-06T16:18:47.424147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.546129Z","title":"Parameswaran","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.546129Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:fca5856308963a529e8c07c2b951113a1b42fb6a32d015ecd5eae4555a898aba","observation_id":"4e97e5b3-d4f6-401a-8497-85f15606a431","resolution":{"observed_at":"2026-08-06T16:18:47.546129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:47.659269Z","title":"A DaQL to Monitor Data Quality in Machine Learning Applications","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.659269Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:eb6aeb975388cea5af9ae06c2f6e7dcd94da4d45944d078080171dbd96ce6fbb","observation_id":"ce2fca88-5788-4b9c-973b-142dc610ed1d","resolution":{"observed_at":"2026-08-06T16:18:47.659269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.procs.2021.01.327","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"DaQL 2.0: Measure Data Quality based on Entity Models","venue":"Procedia Computer Science","work_id":"39c9c273-19e9-434f-a436-df5d0313f69d","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.812609Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:46f15fa00980b1192643f6ac95671e90e0ed18fa5ff7b1dea8f57de7f74321da","observation_id":"d88c3220-2028-491c-8d72-0c332fbad8fd","resolution":{"observed_at":"2026-08-06T16:18:58.455980Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:12.432338Z","title":"Real-Time Monitoring of Data Pipelines: Exploring and Experimentally Proving that the Continuous Monitoring in Data Pipelines Reduces Cost and Elevates Quality","venue":null,"work_id":"301c4b8a-deda-4ec2-8257-616cd7aa75d9","year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:47.931600Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:6c6b2b94c3c30b95734ccd9c9480fae4e4bf1e9b2f6d6ff47948422d065081b4","observation_id":"2f94c143-25fb-4fba-9b4a-93fb3e676313","resolution":{"observed_at":"2026-08-06T16:19:12.618911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:48.097225Z","title":"Schuler, Jitin Singla, Brinda Vallat, Kate L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:48.097225Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:34c041735658892684bc6fb3aecf386f06466b395b64d3d37d638ce857cbe924","observation_id":"07e4821b-96d4-4c39-b7d8-f0d55af075d8","resolution":{"observed_at":"2026-08-06T16:18:48.097225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:48.661781Z","title":"An Empirical Study on the Design and Evolution of NoSQL Database Schemas","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:48.661781Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:518a82ad8a6a3cba38c03a5a5668c5b4b4a72f016367d8b145f47d671655ab91","observation_id":"c81970a9-042b-4869-933a-df366cb6bf88","resolution":{"observed_at":"2026-08-06T16:18:48.661781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:11.992217Z","title":"Schema Evolution in Wikipedia - Toward a Web Information System Benchmark","venue":null,"work_id":"89a95822-4144-4d17-9ab2-e94043e16214","year":2008},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:50.676754Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c04fba4898a9d33c4fa24a9a02846c63178f6a62dd7c4c4c426b1d8bdfa1f485","observation_id":"a1914ddf-841d-4de2-9108-9bf488ec2918","resolution":{"observed_at":"2026-08-06T16:19:12.200356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:11.618932Z","title":"Self-healing and self-repairing technologies","venue":null,"work_id":"c4651e47-f216-45cc-8f98-c4e68ff318a7","year":2013},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:52.847609Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:d7d9c8e171ecf40469385314503aceb0d13ac74e4fe6f574c5695e954b785718","observation_id":"4d12e214-8898-41c5-baff-4d94962b8bbb","resolution":{"observed_at":"2026-08-06T16:19:11.809922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.008184Z","title":"DeBinelle: Semantic Patches for Coupled Database-Application Evolution","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.008184Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:f51ea533cd946aaff33f679abde244e6248d679dcfd801132a7ca689a13f027b","observation_id":"da0be5f1-c65e-4229-ab64-18ebc8b7b24b","resolution":{"observed_at":"2026-08-06T16:18:53.008184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.188784Z","title":"Schuler and Carl Kesselman","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.188784Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:35e9e20d848c96ad4ccca13e2d28178e9a3ae75e2b52d5b7217c3f9e5169ed45","observation_id":"428fe486-fac4-4bf2-9961-0b99e8951fac","resolution":{"observed_at":"2026-08-06T16:18:53.188784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.307232Z","title":"Understanding Uncertainty in Self-adaptive Systems","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.307232Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:45d7334bdb22e8ec9bc0999e15cc7e052d48d48c30fe1bff315d7feea93c5380","observation_id":"f9a8542b-6230-4250-8118-0efbd9f7f5e6","resolution":{"observed_at":"2026-08-06T16:18:53.307232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.02717","last_updated":"2021-03-03T22:05:24Z","snapshot_observed_at":"2026-07-06T10:46:40.459336Z","submitted_at":"2021-03-03T22:05:24Z","title":"Uncertainty in Self-Adaptive Systems: A Research Community Perspective","version":1},"cited_work":{"arxiv_id":"2103.02717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.02717","snapshot_observed_at":"2026-08-06T16:19:05.590355Z","title":"Uncertainty in Self-Adaptive Systems: A Research Community Perspective","venue":"cs.SE","work_id":"f68e20c3-f9a0-4a62-97ca-c5e1214f3f16","year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.394976Z"},"links":{"cited_paper":"/paper/2103.02717","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:2c588ed2737c7e4b784a775eeac6eee2d7044206244a983b18567bdf5911ef8b","observation_id":"19f505fc-5681-42f2-a252-0a0fe1540be6","resolution":{"observed_at":"2026-08-06T16:19:05.817326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.82582","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:05.265252Z","title":"o rl, Daniel M \\","venue":null,"work_id":"15f38582-2445-49d6-9e52-2123223656ab","year":2017},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.515461Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:d93ba1c91e385bfc692ef90fca8d2294efa020e683186719da71f8bc52d5dfa5","observation_id":"d501fa8c-e994-4810-bb39-d0822030c526","resolution":{"observed_at":"2026-08-06T16:19:05.372021Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.618032Z","title":"Reducing Ambiguity in Json Schema Discovery","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.618032Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:dd713f7509b84ba90decb53b036bf3459a76276a0c6649c3ffe3ed47687c1ffb","observation_id":"bd54e1f3-ac28-414f-bec4-0f4089822d44","resolution":{"observed_at":"2026-08-06T16:18:53.618032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11227","last_updated":"2024-06-17T05:50:46Z","snapshot_observed_at":"2026-08-10T06:31:34.363015Z","submitted_at":"2024-06-17T05:50:46Z","title":"Compound Schema Registry","version":1},"cited_work":{"arxiv_id":"2406.11227","doi":"10.48550/arxiv.2406.11227","metadata_source":"pith","pith_arxiv_id":"2406.11227","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Compound Schema Registry","venue":"cs.DB","work_id":"8dbd87a3-210f-40e8-854a-f77a7e532dcb","year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.728233Z"},"links":{"cited_paper":"/paper/2406.11227","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:7e2403b397935c35bf458dd1c94d04d0ae9f99560a7045b1292a34cb92e6a8ea","observation_id":"cc023766-9ba6-4736-9a96-97523abe85c6","resolution":{"observed_at":"2026-08-06T16:18:58.158162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.27045","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:04.683347Z","title":"Control-Theoretical Software Adaptation: A Systematic Literature Review","venue":null,"work_id":"1062663a-03fc-48ab-a938-8473342cf30d","year":2018},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.848631Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:77365836f70452fa1f591f2358c46f77fabaa83a4868fb183009f232028aa1f4","observation_id":"5f1b989c-ee61-48d2-8700-aad06d443bbc","resolution":{"observed_at":"2026-08-06T16:19:04.830517Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:53.988696Z","title":"Agent-Driven Automatic Software Improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:53.988696Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:83adc3315b493527a6183e9df659a3b765f7b64fea4e279e8f6092b613d1c8dc","observation_id":"3c3c7c93-03a1-4970-aec4-37e1c74d5afc","resolution":{"observed_at":"2026-08-06T16:18:53.988696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11390-013-1321-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Fuzzy Self-Adaptation of Mission-Critical Software Under Uncertainty","venue":"Journal of Computer Science and Technology","work_id":"b2fa5849-076b-4d70-baaa-d117d97251c8","year":2013},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.119601Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:47363987ff3edb6f69e6a3db3ba1eb4694b796ce593416bd7095b0a0b2ada385","observation_id":"e8520fca-c0d0-4a57-a1de-d85f9eb9c93f","resolution":{"observed_at":"2026-08-06T16:18:57.904811Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:11.214524Z","title":"Towards Evolution Capabilities in Data Pipelines","venue":null,"work_id":"41db49b1-1d6f-4fad-9628-d79a28611529","year":2023},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.233017Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:4901bcab4be768d6a25d45c42129606fe82be8c1ee5aeeac25f74386aa5dde0f","observation_id":"c91df8ca-20af-444e-affa-bedb5c32f194","resolution":{"observed_at":"2026-08-06T16:19:11.363646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9502.29395","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:04.106158Z","title":"Franklin, and Eugene Wu","venue":null,"work_id":"45433a83-3e67-444d-b6c4-5447edd69559","year":2016},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.357710Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:48ace0aaf50162ca418a65b4f436c9aba60d429e9656e862c04676b461f4bf29","observation_id":"b344b8bf-e27e-4ee2-b61f-720684b7cf4a","resolution":{"observed_at":"2026-08-06T16:19:04.319031Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06439","last_updated":"2021-12-13T06:40:05Z","snapshot_observed_at":"2026-07-06T12:17:56.147137Z","submitted_at":"2021-12-13T06:40:05Z","title":"What can Data-Centric AI Learn from Data and ML Engineering?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06439","snapshot_observed_at":"2026-08-06T16:18:54.488535Z","title":"What can Data-Centric AI Learn from Data and ML Engineering? CoRR, abs/2112.06439, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.488535Z"},"links":{"cited_paper":"/paper/2112.06439","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c3271f90507319a70537f51ce268b168ef577c5f19afb2df89531f5549e0cb91","observation_id":"50879f76-1b1d-42c5-a417-e1546ed087d2","resolution":{"observed_at":"2026-08-06T16:18:54.488535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-39355-6_8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Johnson, Gyorgy Simon, and Constantin Aliferis","venue":"Health informatics","work_id":"416a2409-d88a-4f6c-9d0c-2f3c24b6ea31","year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.611345Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:3603b4005788882f7f9fc1fa3d340905ac609aded9f157291ccc1d029ec621d1","observation_id":"a1b91f72-aa9d-432f-87f9-0d660be4d2a9","resolution":{"observed_at":"2026-08-06T16:18:57.638807Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:54.737601Z","title":"Towards an End-to-End Data Quality Optimizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.737601Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:5e2dd2ff29e7549210e85e01113060a5fbacfa8d9d671798c275d77de9f88531","observation_id":"9cc6aeb6-19c9-4e29-b701-4dad951ee39b","resolution":{"observed_at":"2026-08-06T16:18:54.737601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10115-022-01661-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:03:40.895421Z","title":"Empirical comparison of supervised learning techniques for missing value imputation","venue":"Knowledge and Information Systems","work_id":"3b524355-5709-47cd-a8d8-1068571869da","year":2022},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.844195Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:46f2c1481f7039c356e7efc2850b3e2f82809b561819be1f624557b8e1e1c33d","observation_id":"2ee479b9-5cd2-476b-ba0d-d295106e6bab","resolution":{"observed_at":"2026-08-06T16:18:57.388212Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:10.901417Z","title":"Kamrul Hasan, Md","venue":null,"work_id":"161e1225-220f-426a-949d-795b24f28993","year":2010},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:54.950468Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:81ef1fdf3a3abf94cfcc440bfe5c932e7fc77054b279e732e30d3720841e4266","observation_id":"731f060b-0590-4b7f-aafc-8e9ec9c40b4f","resolution":{"observed_at":"2026-08-06T16:19:11.042201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18420/btw2025-125","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"o rl. ALPINE: Abstract Language for Pipeline Integration and Execution . In BTW Workshops , volume P-363 of LNI , pages 207--217. Gesellschaft f \\","venue":"Gesellschaft für Informatik (GI)","work_id":"eae597c2-2bf1-475a-b050-f9a3484a2851","year":2025},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.088711Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:d55ce6d79984924e32bbb8cc18de0b14eb4efd06d8d757667a4878b3205dd1ee","observation_id":"b9c52985-0620-405f-ae9e-a10a504d9556","resolution":{"observed_at":"2026-08-06T16:18:57.067167Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:10.561162Z","title":"Towards machine learning-aware data validation","venue":null,"work_id":"a7bb8f02-c32c-4e38-9719-44967601bfd2","year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.236087Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:dc023e6ce3e8564920e0c031ec30ed7a46a324e28b00f52551bc045f3409f931","observation_id":"1ae8f269-34d4-4061-b9a5-93adc9d603d5","resolution":{"observed_at":"2026-08-06T16:19:10.717533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:55.385634Z","title":"Transparent Data Preprocessing for Machine Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.385634Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:9ae525b80a0b51f1cf10b3e48127721f1a7d17ab58d07248e312c03d31685cd0","observation_id":"9b410dab-750d-48a3-88d6-ff4df8bc98ae","resolution":{"observed_at":"2026-08-06T16:18:55.385634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:18:55.567021Z","title":"Breunig, Hans - Peter Kriegel, Raymond T","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.567021Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:9295271e389fb87277f0636dce96176605eeebad3881e02814cf099c34e8f5d1","observation_id":"a1450a14-2a19-4bd4-8b1f-591e679e4fd9","resolution":{"observed_at":"2026-08-06T16:18:55.567021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:10.143028Z","title":"Kramer, Valerie Restat, and Uta St \\\" o rl","venue":null,"work_id":"b1529543-387c-4e2d-89f6-ad43336bdf4e","year":2025},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.716135Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:c5df58f1dd7394c45f6f484563047733dfc46e4cb22da4dcdac1bc08de7011f7","observation_id":"27cf353c-c40b-48ac-a0fd-876777397731","resolution":{"observed_at":"2026-08-06T16:19:10.323257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.11600","last_updated":"2020-03-25T19:47:30Z","snapshot_observed_at":"2026-08-06T19:44:28.339019Z","submitted_at":"2020-03-25T19:47:30Z","title":"Birefringent Graphene Oxide Liquid Crystals in Micro-channels for Optical Switch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.11600","snapshot_observed_at":"2026-08-06T16:18:55.852431Z","title":"Kephart and David M","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:55.852431Z"},"links":{"cited_paper":"/paper/2003.11600","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:f1da4346cb827b92202d2006bf8ebde62816d061f416007da8f8b97d317f7827","observation_id":"d1285b19-8c7e-4616-840f-2648b49ec632","resolution":{"observed_at":"2026-08-06T16:18:55.852431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:09.875824Z","title":"A Survey on Application of Knowledge Graph","venue":null,"work_id":"cf2a5871-4c21-4abe-a892-4b6a93c528ce","year":2020},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:56.007444Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:5bc0d0b75bb525339c4f938573c79f662f09f28e35294e6139b6837683bb1ba4","observation_id":"32b2fe69-75f1-40ac-be31-ae15b4200396","resolution":{"observed_at":"2026-08-06T16:19:10.001582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03286","last_updated":"2024-07-03T17:17:37Z","snapshot_observed_at":"2026-08-09T14:32:50.043724Z","submitted_at":"2024-07-03T17:17:37Z","title":"Large Language Models for JSON Schema Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03286","snapshot_observed_at":"2026-08-06T16:18:56.176603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:56.176603Z"},"links":{"cited_paper":"/paper/2407.03286","citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:d65ef4fd57513ff366bafedc2be8e82b8272ef4c358635c2f079270973d9b43e","observation_id":"5f63074e-964a-48ff-83f4-1b6bedd8688f","resolution":{"observed_at":"2026-08-06T16:18:56.176603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-87568-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Towards Taming the Adaptivity Problem - Formalizing Poly-/MultiStore Topology Descriptions","venue":"Communications in computer and information science","work_id":"6e4b79e8-f6ca-4227-a372-0e6fda226f13","year":2021},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:56.330463Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:d301c6e839bbfe256787d1c8b526af50a9b1232a7edfc00901db02425abcae57","observation_id":"c03459ec-e8f2-4420-8aa6-d1b8f5322618","resolution":{"observed_at":"2026-08-06T16:18:56.803394Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:09.613474Z","title":"Schema Extraction and Structural Outlier Detection for JSON-based NoSQL Data Stores","venue":null,"work_id":"3c828ee4-bc4e-44d2-a50b-8b15efa2accf","year":2015},"citing_paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T16:18:56.509967Z"},"links":{"citing_paper":"/paper/2507.13892"},"observation_digest":"sha256:270e7cf315e8bd123beaee8a39c7f7a8d8f73e7e6788dabeed7a420e223b47ba","observation_id":"d4010b8f-901c-4870-80f6-ed1a887dfc07","resolution":{"observed_at":"2026-08-06T16:19:09.753709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13892","last_updated":"2025-07-29T13:34:53Z","latest_version":2,"primary_category":"cs.DB","snapshot_observed_at":"2026-08-09T03:14:17.957768Z","submitted_at":"2025-07-18T13:12:55Z","title":"Towards Next Generation Data Engineering Pipelines"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":38,"verified_exact":24,"verified_fuzzy":13},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2507.13892."}