{"as_of":"2026-08-11T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56b1cc7a46f30c1802d0a1cf99ccf3829b0810f28f2ce6cef50f13f27362a15b","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:39:44.824894Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20369/citation-record","integrity":"/paper/2507.20369/integrity","json":"/paper/2507.20369/citation-record.json","paper":"/paper/2507.20369"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.579938Z","title":"Clusters models, factors and characteristics","venue":null,"work_id":"57019937-dd71-48e0-9371-4a6960e90828","year":2011},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.234249Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:05fa9016cf5c323533ec595157d66d3e97203e96f1ed42e169df69abacb4515b","observation_id":"624beb39-a21f-4ffb-8a62-7a6ba5275d20","resolution":{"observed_at":"2026-08-06T13:39:48.716144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.277778Z","title":"Data mining: concepts, models, methods, and algorithms","venue":null,"work_id":"bb55389f-5dc5-448e-9675-b849f9bade39","year":2011},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.306413Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:48c9348ab15e42d8612d881ee11e472a8e0cedd0c75c71f8a5a2acfe12547c6d","observation_id":"ebd62e6f-67c4-4ac1-8697-45c567b4c870","resolution":{"observed_at":"2026-08-06T13:39:48.434748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.956352Z","title":"A novel clustering approach: Artificial bee colony (abc) algorithm","venue":null,"work_id":"46b34d95-5d2a-4506-9fee-f0369be74123","year":2011},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.524538Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:50755eef8761be5f593032fc79b8af04c804c6f5945d7763489e858cb617d7c8","observation_id":"e7f032c1-26e3-4c12-8147-3466266b6205","resolution":{"observed_at":"2026-08-06T13:39:48.114991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.625255Z","title":"Data clustering: a review","venue":null,"work_id":"ff712829-fc64-479b-8f7f-80b20e026230","year":1999},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.624925Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:3a0add4edef8c6949e8818451780ace77c81a94baa8f3151d0edf868f4ca6565","observation_id":"f57b3f2b-d751-4e8f-a717-92b320a4d7fa","resolution":{"observed_at":"2026-08-06T13:39:47.741517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.315471Z","title":"Data mining and knowledge discovery handbook","venue":null,"work_id":"f666d82e-84c4-433d-9d6d-df7db8ffb9b3","year":2010},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.754830Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:7fa263c07a63d193028331d12c29519ffa1978b27778a4b4afb11becaed22385","observation_id":"231ffbb1-23d6-4143-ade5-5ba16bca18af","resolution":{"observed_at":"2026-08-06T13:39:47.431864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.989160Z","title":"Mathematical classification and clustering, volume 11","venue":null,"work_id":"ff115a97-5042-4792-992c-38dc901c40b8","year":1996},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.846811Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:7ec7b2310df5c84f4b814d9b6979e63e4f7e854adc0d9b3f24ad87008342f5f5","observation_id":"f5de3ba1-04b6-4a15-a2ba-ddf70c3cba66","resolution":{"observed_at":"2026-08-06T13:39:47.152747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.710992Z","title":"Some methods for classification and analysis of multivariate observations","venue":null,"work_id":"6a54a367-8eff-4f08-aa93-7c7efc854d42","year":1967},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.954767Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:d50d42f5c6c09b9acaebd601a22c26da6a5ce8396a8d6dce05197f3dc4677ff1","observation_id":"1ee9454d-decd-4133-91cd-6e56438073f7","resolution":{"observed_at":"2026-08-06T13:39:46.810385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.110416Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.110416Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:1dde0264f2023aed6a1dcbf8843a0fb4c069fba7fb4353029d288d2088034306","observation_id":"3d7bc5db-4254-4839-892e-a166c680c87d","resolution":{"observed_at":"2026-08-06T13:39:43.110416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10510","last_updated":"2024-08-13T09:58:44Z","snapshot_observed_at":"2026-08-10T15:07:08.443841Z","submitted_at":"2021-12-20T13:07:39Z","title":"Transformers Can Do Bayesian Inference","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10510","snapshot_observed_at":"2026-08-06T13:39:43.205319Z","title":"Transformers can do bayesian inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.205319Z"},"links":{"cited_paper":"/paper/2112.10510","citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:299661e15623901338fe726bf4357201299bde25f9e37565ad37f292ae6ca045","observation_id":"57b28469-b0ee-4162-9e42-04a59c6559df","resolution":{"observed_at":"2026-08-06T13:39:43.205319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01848","last_updated":"2023-09-16T09:33:32Z","snapshot_observed_at":"2026-07-06T13:27:49.894090Z","submitted_at":"2022-07-05T07:17:43Z","title":"TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01848","snapshot_observed_at":"2026-08-06T13:39:43.344754Z","title":"Tabpfn: A transformer that solves small tabular classification problems in a second","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.344754Z"},"links":{"cited_paper":"/paper/2207.01848","citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:330b5fab3771b751c77e566fc3c9eb33f6a2ebba85a56c8ac2ece08cc291e3fc","observation_id":"fa4d1807-ae3e-4c96-ab52-74b2803d825d","resolution":{"observed_at":"2026-08-06T13:39:43.344754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.434764Z","title":"u ller, Lennart Purucker, Arjun Krishnakumar, Max K \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.434764Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:b5d282e5e9cb8f32854236ae7830388c2b6fb0973011415e0838cd71bf5bfd62","observation_id":"ab45d90e-3418-4f41-a911-8348974500bd","resolution":{"observed_at":"2026-08-06T13:39:43.434764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.324607Z","title":"Efficient bayesian learning curve extrapolation using prior-data fitted networks","venue":null,"work_id":"d90bafed-5061-42b7-91c1-e5c2a52292a2","year":2022},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.562421Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:9b3b47e0b782d90eba62a79cad11c37c6460419acab678466ad3f12d29f9074c","observation_id":"f98b30ca-9531-4995-bcac-28156b5a31ac","resolution":{"observed_at":"2026-08-06T13:39:46.494900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.187459Z","title":"Forecastpfn: Universal forecasting for healthcare","venue":null,"work_id":"190ba0cd-e567-492d-917a-c9c059d23847","year":2023},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.723685Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:510cb705fc32f79178b98ffb24f03350d2140d38cd6b1b067d81330c76296e0f","observation_id":"c0a74c63-03b7-420e-8ca3-7773b915f269","resolution":{"observed_at":"2026-08-06T13:39:46.206527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11097","last_updated":"2023-05-18T16:34:21Z","snapshot_observed_at":"2026-08-05T03:37:32.587185Z","submitted_at":"2023-05-18T16:34:21Z","title":"Statistical Foundations of Prior-Data Fitted Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11097","snapshot_observed_at":"2026-08-06T13:39:43.874825Z","title":"Statistical foundations of prior-data fitted networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.874825Z"},"links":{"cited_paper":"/paper/2305.11097","citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:e4e6fbc36f2e47c9b740eb9e79c71e277f55dc22433613afcb507ec365d4ea1a","observation_id":"c7b8b196-460e-42c4-8e7d-e6028c0a66b0","resolution":{"observed_at":"2026-08-06T13:39:43.874825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.053838Z","title":"On the method of bounded differences","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.053838Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:821b80daff58e9d70c27c098804e78dd30f9e0bcff134f195427a7071b20c20e","observation_id":"8ac28109-46c2-42cd-bffa-a6d07e52ba0a","resolution":{"observed_at":"2026-08-06T13:39:44.053838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.204760Z","title":"Pedregosa, G","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.204760Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:e65aea73824e2796864200d36928d6cedf949cd3e167a1037d56733ab70ddad9","observation_id":"85346a02-3eb2-414c-bb54-dfc73cf21cd7","resolution":{"observed_at":"2026-08-06T13:39:44.204760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.691674Z","title":"V-measure: A conditional entropy-based external cluster evaluation measure","venue":null,"work_id":"429c761a-47c6-4102-b80b-39c05d34c339","year":2007},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.335634Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:93965848058be0f2574d8e330f3ac664896b6996145f6a21af2f3d2d1a45d49b","observation_id":"402e3a24-ea65-4dc6-aa3e-474810627230","resolution":{"observed_at":"2026-08-06T13:39:45.926891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.482194Z","title":"The mnist database of handwritten digit images for machine learning research","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.482194Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:11cbffd8c864b8f08da78297c012e2ffb17f82329040b4346ca1405d0b43a077","observation_id":"128ee1d8-e2c7-4a70-a5e0-5da71b37bbc9","resolution":{"observed_at":"2026-08-06T13:39:44.482194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.614993Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.614993Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:197026714264af1903891bb82cb48d5e9438ffd4724b02068e88d00a39427a86","observation_id":"92783d63-bab6-4f23-be67-e8dd252d2c11","resolution":{"observed_at":"2026-08-06T13:39:44.614993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T13:39:44.729315Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.729315Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:1e546fd804b888d858e25feb3e2dd67d699a169c8fd1613f9d5f86ad5bd39100","observation_id":"55c6f77e-c517-4ec0-ada9-391492931caf","resolution":{"observed_at":"2026-08-06T13:39:44.729315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.325809Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"92737b3c-d025-4735-a93b-f21f532d72c1","year":2020},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.824894Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:8089d901c88e752aca5068b5188a567de6c27d89aa89cf01062fe3679e3b775f","observation_id":"878e9435-62fd-4c8b-839f-bc645583b020","resolution":{"observed_at":"2026-08-06T13:39:45.444893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:59:59.482470Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2507.20369."}