{"as_of":"2026-08-10T18:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12c9f1121a2d2a218ba6c47eb10dcb40be4929d7fc1d0bcccce9a05f64c36cbb","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:47:13.856071Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23532/citation-record","integrity":"/paper/2506.23532/integrity","json":"/paper/2506.23532/citation-record.json","paper":"/paper/2506.23532"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.816560Z","title":"Slic superpixels compared to state-of-the-art superpixel methods","venue":null,"work_id":"a822e6ca-d38a-4910-85dd-da0e7989ae5d","year":2012},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.014039Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:b9c04f399cf74d9c0d96a3c53d227a39b1ccd2645a18a9dc3a49b5e0e7feaea0","observation_id":"9945d05e-7020-4d1e-9ab0-bd728522523a","resolution":{"observed_at":"2026-08-06T21:47:18.892758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T21:47:11.069323Z","title":"Beit: Bert pre-training of image trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.069323Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:472fefa991fc87fe100c2334ad1746cdcd9bafc0d1bd2e83bb91b42f733645ae","observation_id":"2c890d52-e762-428e-9657-dad3cf888b27","resolution":{"observed_at":"2026-08-06T21:47:11.069323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.719405Z","title":null,"venue":null,"work_id":"6fafe7d2-96df-46df-9970-e7947c92a7c6","year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.138184Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:41e3006bcaa763fc0b4f247df1cc0e6c6b79b602c09cc7febb491c94f89a778e","observation_id":"0092c7e7-3d0d-4b55-b20f-f251c06928f2","resolution":{"observed_at":"2026-08-06T21:47:18.746717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02364","last_updated":"2024-10-25T08:27:37Z","snapshot_observed_at":"2026-08-10T09:39:42.992294Z","submitted_at":"2023-12-04T21:46:21Z","title":"Class-Discriminative Attention Maps for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02364","snapshot_observed_at":"2026-08-06T21:47:11.202139Z","title":"Class-discriminative attention maps for vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.202139Z"},"links":{"cited_paper":"/paper/2312.02364","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:199201fedb8873009e63a46a88bd191c3fdc672a760b3ea4a7fef1a681f81bf8","observation_id":"5910e295-c639-4bc8-80ed-03a55f33dc01","resolution":{"observed_at":"2026-08-06T21:47:11.202139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:11.235366Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.235366Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:66e232d8d10a7b5c37719db56966b5dea0808b90f8ec6d560e2d4fd560f0fd73","observation_id":"fd5ef612-735c-428c-a5a7-dfeddb721ae2","resolution":{"observed_at":"2026-08-06T21:47:11.235366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10555","last_updated":"2020-03-23T21:17:42Z","snapshot_observed_at":"2026-08-06T14:37:14.514749Z","submitted_at":"2020-03-23T21:17:42Z","title":"ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10555","snapshot_observed_at":"2026-08-06T21:47:11.283757Z","title":"Electra: Pre-training text encoders as discriminators rather than generators","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.283757Z"},"links":{"cited_paper":"/paper/2003.10555","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:7d278d91bbcb7812758ca861ac23abf5a4194f1114b255b5c5a9124021db167c","observation_id":"936e8e54-4ae0-45ba-b2b1-bb233b9fc377","resolution":{"observed_at":"2026-08-06T21:47:11.283757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.577859Z","title":"Vision transformers need registers","venue":null,"work_id":"bbbdeb00-bc53-4c49-ad9f-127a1c10b9fd","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.350695Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e5a856a5b4e5195046d6507c8d2cfeb08cde42b03d90b5e1f55cd45a37811fa5","observation_id":"f4c5c823-5540-4b5a-b51a-db3931724776","resolution":{"observed_at":"2026-08-06T21:47:18.656085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:11.395995Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.395995Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e45ae070913ad5bb4397d0a95ce30390772667a6fca203ece025e062d6e10b7a","observation_id":"37e73944-bae5-47a0-860c-c20c99361830","resolution":{"observed_at":"2026-08-06T21:47:11.395995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:11.450427Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.450427Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:0b85ba51dbf49086a912345988e7ed77e69c365938c261668cf9792facd34e12","observation_id":"fdd7961f-9de7-4c5f-be6a-aead69cc1528","resolution":{"observed_at":"2026-08-06T21:47:11.450427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.415360Z","title":"Adaptive slot attention: Object discovery with dynamic slot number","venue":null,"work_id":"71a1b351-57e9-4fcb-b1db-839334be6850","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.569998Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:d91573a49cac0b16a93806dc19e5f877c161cdab4a744ebc4e80fbc97c1193e0","observation_id":"9c3db3c5-a6d1-4b5d-ba0d-e706919159f9","resolution":{"observed_at":"2026-08-06T21:47:18.466824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.313662Z","title":"3d gaussian splatting as new era: A survey","venue":null,"work_id":"2191ea88-87fb-432c-8d2a-a738781f6dcd","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.604742Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:694e7ff5836cfa0dfd1a8ce644102bf9b3efd37cc122a0813b0794bcc90c12dd","observation_id":"f66e188e-2881-48ee-bffe-e431d0f62f50","resolution":{"observed_at":"2026-08-06T21:47:18.364413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.190804Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":"0fce1091-407b-4250-82a7-6e06d96ffc85","year":2004},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.656350Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:d2401703407581e972ec70d9d2ea54d3065f1ddb985321507d476e0152b6ee43","observation_id":"c1fc16db-617d-46d9-86a7-162eed514be1","resolution":{"observed_at":"2026-08-06T21:47:18.238363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:18.062803Z","title":"Understanding the difficulty of training deep feedfor- ward neural networks","venue":null,"work_id":"e7a82d4f-f44d-4198-bcfa-ab95922a69ae","year":2010},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.719489Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:a8105bd6bc1edf28bc19dc4baf95c3bba7e9942f5da22e7ae1d171f3c6c5cdf6","observation_id":"579af9de-e56a-451e-b5b9-2714f0311f26","resolution":{"observed_at":"2026-08-06T21:47:18.119540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T21:47:11.771826Z","title":"Explaining and harnessing adversar- ial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.771826Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:29340f2eba828ec43da4926a4121f25dc11b246466ed683d1af1635f182e9bd6","observation_id":"ff0bb9f3-9761-48f2-affb-e7a0de90b98a","resolution":{"observed_at":"2026-08-06T21:47:11.771826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-06T21:47:11.840094Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.840094Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:dca53f73dc7c3ccecd8d0ce30609bb3fc1240c7b9df3026917d99b162eb94d59","observation_id":"b192aebd-5bf7-4416-977f-feba17913d7e","resolution":{"observed_at":"2026-08-06T21:47:11.840094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.932259Z","title":"Faster neural networks straight from jpeg","venue":null,"work_id":"3053297b-650d-4a03-ad7b-8436e2822e36","year":2018},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.888156Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:bc29e76f3d394e2eda9bd3db2c00fd3eb218f7cb7bd46da56ad23a7b9896173d","observation_id":"3c6a61b4-d77f-49b5-bc12-b73b59d2e83d","resolution":{"observed_at":"2026-08-06T21:47:17.992426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:11.946548Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:11.946548Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:aa398f4a4438efe3e4c61b2e5810a96396bf10ebb0f1b342f1c79a4b3ab7a45a","observation_id":"dc0b8bf2-6a07-4b45-a0b1-4398de97033a","resolution":{"observed_at":"2026-08-06T21:47:11.946548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.834964Z","title":"Deep residual learning for im- age recognition","venue":null,"work_id":"7785d6ef-1860-4ef5-8cf3-028640e25ddb","year":2016},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.019522Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:1a21ac028df025c5304c450dbf5d06512687246bc13c11bca35d0a8e87469018","observation_id":"261a297a-38f0-42d1-a87a-84055dd8365c","resolution":{"observed_at":"2026-08-06T21:47:17.880417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.713825Z","title":"Bytes are all you need: Transformers operating directly on file bytes","venue":null,"work_id":"5851e72b-a894-46a4-a620-df070a050566","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.058765Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:4c63ee01f02ecc40fd3a59cfdcf6aa75e59d1c127745c9ab30c3daf54945424f","observation_id":"846f3813-b848-4d05-990d-3c5ce50e77ea","resolution":{"observed_at":"2026-08-06T21:47:17.757233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.602604Z","title":"2d gaussian splatting for geometrically accurate radiance fields","venue":null,"work_id":"19d1527d-9b5b-4d5d-bd31-447513f7dca4","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.080524Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:27d43844d79981703cb75def58e0cfbf63854ce6b15bb8f056b6eb72a4250b74","observation_id":"200ecfb6-b37f-43f2-9086-224e9134a633","resolution":{"observed_at":"2026-08-06T21:47:17.643782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.478799Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","venue":null,"work_id":"60bd5df6-a45f-4341-9e01-2c3b8f3b9a0e","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.133865Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:1450c2b72876fd646b7dc6706b4bb51d972475ae0dbf532ecf881d13009df419","observation_id":"fa411bc1-4037-4db5-8286-9e0aeb480988","resolution":{"observed_at":"2026-08-06T21:47:17.543035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.344035Z","title":"Perceiver IO: A general architecture for structured inputs & outputs","venue":null,"work_id":"c0c173d1-6171-493f-acfc-653d8ef31772","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.186546Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:9c3e8e6e910b886bc90eaf37f2da3f49a468eaeacf74d0981aafca77040463f4","observation_id":"8b67a148-fc63-4ce8-97dd-954a45b029db","resolution":{"observed_at":"2026-08-06T21:47:17.398396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.241166Z","title":"Perceiver: General Perception with Iterative Attention","venue":null,"work_id":"66721b5a-bcf4-4025-bc6b-d216185faef0","year":2021},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.228976Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:812a7ebd3e116e47ad508ef5a3803afbbcf2db5d6223b6a1ee8bcbb6e8f043b2","observation_id":"b1e8f434-2fcf-4c5b-a4b2-4ecf418d0a53","resolution":{"observed_at":"2026-08-06T21:47:17.294073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.107100Z","title":"Superpixel sampling networks","venue":null,"work_id":"82ea55e3-e0bd-40ba-834c-548e2f500053","year":2018},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.286148Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:48c8e04583d88b871330c6e29b1e12cc12f699aad879abf6e25bb5d218ac1b0a","observation_id":"ea2f901f-f3cd-4cd1-80f6-79f9c737a85f","resolution":{"observed_at":"2026-08-06T21:47:17.179891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:17.016509Z","title":"Unsupervised image segmentation by backpropagation","venue":null,"work_id":"3f232c53-a304-4d02-bda6-13f0e7f218fa","year":2018},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.336586Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:ba51f48f950efab3d24c4577db31034820399d9c605cb629172c2fafad329ed8","observation_id":"3738d5c8-68ff-4a31-be72-2ea36e1b9ea0","resolution":{"observed_at":"2026-08-06T21:47:17.066064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.918040Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"cee0cc23-2ef9-47b8-bb78-e703533e9313","year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.396900Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:b727a08c8822d25b3087229ae0dc2dae7c082db149d9cc3fcda3550d5e3036f1","observation_id":"56d5519e-e377-4930-93b9-f89ca3ee78ca","resolution":{"observed_at":"2026-08-06T21:47:16.962101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.706884Z","title":"Seac and the start of image processing at the national bureau of standards","venue":null,"work_id":"44cd3dfa-bde5-4e01-b943-e44f9ec7a7ff","year":1998},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.452282Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:948ba6205237e14bb49d88c2ac75f5958578296e5d37737d5af8a91d4773ac74","observation_id":"a6efc2d2-c4bc-4755-a961-289d45fa081b","resolution":{"observed_at":"2026-08-06T21:47:16.825354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.533113Z","title":null,"venue":null,"work_id":"5fca79c3-4215-45ec-b392-2071160d7e17","year":2012},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.508278Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:0e948878cf6de026e45fe3947648e2d2cc47b4242b2da0c20385b4714d7e86f8","observation_id":"7ab25380-ec07-491d-b429-42da834e935e","resolution":{"observed_at":"2026-08-06T21:47:16.628991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.300185Z","title":"Kutulakos, David J","venue":null,"work_id":"42381cd8-fe6a-439e-bf87-9abddbcc189d","year":2009},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.567226Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:b596740571b7ddf5830d212f2e59b044350861fd6d01347b8851c4d0593c5ac7","observation_id":"6ba2d68d-75c3-4501-8c4f-b387e64c880e","resolution":{"observed_at":"2026-08-06T21:47:16.415159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-06T21:47:12.598568Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.598568Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:939c36a4ce6935b5b8426403db0d2c353631950386122afe6d8c68e8b7382867","observation_id":"a6cba2a0-19ec-475c-a0c7-e0cc0eefc094","resolution":{"observed_at":"2026-08-06T21:47:12.598568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.164892Z","title":"A convnet for the 2020s","venue":null,"work_id":"d85090ce-bd26-42fe-becd-147c9b5880c9","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.646382Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:b3d1d4d1c0867b0fff1b8d3208eb06215934a45503cedb91937438407d66ae58","observation_id":"2c815d31-fe80-4758-a764-4601fe534137","resolution":{"observed_at":"2026-08-06T21:47:16.205710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:12.704280Z","title":"Object-centric learning with slot attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.704280Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e87fbb8765577e69c261e844eb8461c4477b99a65790bcb805e8ede10ced93e9","observation_id":"bdd6e5d4-4c34-4d8b-9461-9dcca0ac6c66","resolution":{"observed_at":"2026-08-06T21:47:12.704280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:16.051388Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"ef40cf07-58d3-4c4f-8365-752b18e8db16","year":2016},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.746140Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:cd6cb02e39654d12187f70661259a7db939e735b9e20dc4cbedeeba905291273","observation_id":"d926a667-08f5-4c40-bb5b-b0e508e55a00","resolution":{"observed_at":"2026-08-06T21:47:16.093469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:47:12.793127Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.793127Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:5eb2f495e77665600f218b66c9a9a22a02c0abdc3b0f577d9b8e35d12b4a45e5","observation_id":"30cabcaf-6846-453f-a2e5-9f7095397d4b","resolution":{"observed_at":"2026-08-06T21:47:12.793127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07735","last_updated":"2022-09-16T06:25:06Z","snapshot_observed_at":"2026-07-06T13:52:55.040189Z","submitted_at":"2022-09-16T06:25:06Z","title":"Enhance the Visual Representation via Discrete Adversarial Training","version":1},"cited_work":{"arxiv_id":"2209.07735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.07735","snapshot_observed_at":"2026-08-06T21:47:14.258461Z","title":"Enhance the Visual Representation via Discrete Adversarial Training","venue":"cs.CV","work_id":"b17aa2fc-85b5-4d9f-89b5-16acadc2f192","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.882028Z"},"links":{"cited_paper":"/paper/2209.07735","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:bfae47bef87f921a0767bf746a0020b9f8dc840837fe834366993d16530e4fff","observation_id":"f9c6bfc4-7a58-4297-a4ed-650674a643db","resolution":{"observed_at":"2026-08-06T21:47:14.362286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.908799Z","title":"An image is worth more than 16x16 patches: Exploring transformers on individual pixels","venue":null,"work_id":"d4caadc3-5254-4261-b0a5-62721a3a0451","year":2025},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.940750Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:81f1476e6cd55684e59688ccb0d70e633d78174b2306d36f23649f4d1bc1f0e0","observation_id":"cf18a7bb-9b6b-4674-8f32-bc1ff44f1e3c","resolution":{"observed_at":"2026-08-06T21:47:15.980100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.826636Z","title":null,"venue":null,"work_id":"b955f1be-750a-4660-9243-497937a01c8a","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.965051Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:c274622d3638285fdb78f6f547aea6adb5bb40e8ce586703e3f2dbf5c6a5ddc3","observation_id":"42d1f6b9-685f-462f-9500-ad2e411fcf97","resolution":{"observed_at":"2026-08-06T21:47:15.875334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.638320Z","title":"Rgb no more: Minimally-decoded jpeg vision transformers","venue":null,"work_id":"24e1d057-538c-4a58-838c-8690b2909cf8","year":2023},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:12.993161Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:3beb1d5149cbd5c82900e1ac2a696bd9e5ad9271723f23edcc5c21cc95bdecdf","observation_id":"e517d215-d6b7-45cc-b96d-efacca6aeec9","resolution":{"observed_at":"2026-08-06T21:47:15.695604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03229","last_updated":"2025-01-06T18:59:57Z","snapshot_observed_at":"2026-08-10T08:08:22.909142Z","submitted_at":"2025-01-06T18:59:57Z","title":"Gaussian Masked Autoencoders","version":1},"cited_work":{"arxiv_id":"2501.03229","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.03229","snapshot_observed_at":"2026-08-06T21:47:14.067098Z","title":"Gaussian Masked Autoencoders","venue":"cs.CV","work_id":"658af24c-1df2-4788-b5d5-1a2df571d2a3","year":2025},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.040502Z"},"links":{"cited_paper":"/paper/2501.03229","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:252eb32a18a96fa1a8beb298bf29dd7e54f124336b34e4f7e75291f312be393f","observation_id":"51ff19dd-a76a-45ab-9c72-8799982fd377","resolution":{"observed_at":"2026-08-06T21:47:14.169384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.442619Z","title":"Learning a classification model for segmentation","venue":null,"work_id":"3f713315-cc39-4e87-b2d7-e351889b5dda","year":2003},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.079031Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:3abbdb065dfb9071d16e49fc7f09ee8bd4226fc20e577c1e800fa880544238ed","observation_id":"326b0d3b-41f2-4a27-9b57-1129e725fce4","resolution":{"observed_at":"2026-08-06T21:47:15.493510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T21:47:13.101183Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.101183Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:fa650322e638edbe45680d74021cc6bfb10dbbabb61ce10764c347aee53de35e","observation_id":"0836e8a5-4ef1-445b-bacb-576c6956ee30","resolution":{"observed_at":"2026-08-06T21:47:13.101183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.236255Z","title":"How to train your vit? data, augmentation, and regularization in vision transformers","venue":null,"work_id":"a4393ef4-01b7-45cf-b120-df9d42573a2b","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.151121Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:a86d4c49e0b7373ad1e24891bff9f9e14c023d04006a84d7b87aef7ae9dadbe7","observation_id":"c0ea71a1-20eb-4917-9fc1-5c0ec8c287e8","resolution":{"observed_at":"2026-08-06T21:47:15.305740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.212064Z","title":"Superpixels: An evaluation of the state-of-the-art","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.212064Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e138c7f8b1245eeee9c15ae52327761cd2921849a22d17014071b552d3483005","observation_id":"a4d8a551-bbbe-44e0-a939-83fbef92fc93","resolution":{"observed_at":"2026-08-06T21:47:13.212064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:15.048596Z","title":"Single-view view synthesis with multiplane images","venue":null,"work_id":"38ae34e1-72de-4af3-a77e-d6efd002d9e9","year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.236571Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:9a7efc39374c3fc269af5dfad00c30f6f56dd3f5852e8b19a1a2bf5bb06eaba1","observation_id":"5340c48a-b528-4227-a4de-b16e52df9857","resolution":{"observed_at":"2026-08-06T21:47:15.139091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.279370Z","title":"Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.279370Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:fc79ecd5875323c95fad9ee8f9b8bb5a62a85bfc317c2342af4b3ff9654bd790","observation_id":"635841d9-9702-4ce9-8f0c-7eb7efbe101f","resolution":{"observed_at":"2026-08-06T21:47:13.279370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.354326Z","title":"Matching networks for one shot learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.354326Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:80cfe81fbadd5e4881685830b146dedbbd53657cc83fb54d8cfba98d837f3dcf","observation_id":"ffd14c20-ccef-4ae2-ab4f-20b68397693d","resolution":{"observed_at":"2026-08-06T21:47:13.354326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.357382Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.357382Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:38f841c3c3dbfdf86926468f8cb9c87a401405738e0a01fd47a30556731e8565","observation_id":"e1d282c4-f13d-41c1-801a-ac2fb39a08f0","resolution":{"observed_at":"2026-08-06T21:47:13.357382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19155","last_updated":"2024-02-29T13:38:07Z","snapshot_observed_at":"2026-08-09T21:45:00.905222Z","submitted_at":"2024-02-29T13:38:07Z","title":"Beyond Language Models: Byte Models are Digital World Simulators","version":1},"cited_work":{"arxiv_id":"2402.19155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.19155","snapshot_observed_at":"2026-08-06T21:47:13.964193Z","title":"Beyond Language Models: Byte Models are Digital World Simulators","venue":"cs.LG","work_id":"1baa0266-3be4-4ed7-bdbd-cfb5232d9e1e","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.372641Z"},"links":{"cited_paper":"/paper/2402.19155","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:8d236ba9c564a652279103f41401ba015dd755e5b40ac87e9bc5934eec831fb6","observation_id":"06c8f80a-1f85-441c-86cf-7007377b6e37","resolution":{"observed_at":"2026-08-06T21:47:14.007426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:14.899910Z","title":"Learning in the frequency domain","venue":null,"work_id":"4db8146c-f845-4b9f-9f59-720912725ed3","year":2020},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.442882Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:c24957eb45f3fca0569920ae915f7e9801c60f66e2b1bbc40c77aff16b46c660","observation_id":"5135e461-daef-48a1-bcdd-0af3d01951a0","resolution":{"observed_at":"2026-08-06T21:47:14.983179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:13.546287Z","title":"gsplat: An open-source library for gaussian splatting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.546287Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:a3969b764efe030044acedf3cc839b729854964c75a07af73c1c2371b523a131","observation_id":"c8e13307-e537-4105-9de6-390e916900c0","resolution":{"observed_at":"2026-08-06T21:47:13.546287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T21:47:13.608125Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.608125Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:2ca1097426d4b9b70c14f388ca179aa97d64775e40070ea1e6b8ce6f9defac7e","observation_id":"3daf0d46-cb1e-448f-a58b-7f7da4af2f18","resolution":{"observed_at":"2026-08-06T21:47:13.608125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.00173","last_updated":"2022-07-30T09:59:28Z","snapshot_observed_at":"2026-08-10T17:46:05.868082Z","submitted_at":"2022-07-30T09:59:28Z","title":"A Survey on Masked Autoencoder for Self-supervised Learning in Vision and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.00173","snapshot_observed_at":"2026-08-06T21:47:13.697596Z","title":"A survey on masked autoencoder for self-supervised learning in vision and beyond","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.697596Z"},"links":{"cited_paper":"/paper/2208.00173","citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:3862bf828f425f3273af77e22ee0ccb0b944a7878ebdf746e3e715cd1904c261","observation_id":"ba8285a7-b6e8-454e-b4eb-2ab2b9d54e0a","resolution":{"observed_at":"2026-08-06T21:47:13.697596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:14.693453Z","title":"Gaussianimage: 1000 fps image representation and compression by 2d gaussian splatting","venue":null,"work_id":"0385e056-cf9c-411b-90a6-151234f25e74","year":2024},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.794092Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:e7e5d18ac1c31d1b5105ebd094d0ecd51bc94ec9391fd63d977140f5c7773f11","observation_id":"8da1c4bd-7218-4bd1-8d90-9ac99f21af3d","resolution":{"observed_at":"2026-08-06T21:47:14.800213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:47:14.522916Z","title":"Self-supervised learning of object parts for semantic segmentation","venue":null,"work_id":"b04ca110-d3f5-4782-abe3-3e1cc61ea9b1","year":2022},"citing_paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:47:13.856071Z"},"links":{"citing_paper":"/paper/2506.23532"},"observation_digest":"sha256:c90b4dc8ff37d4673bd15fd4c4e3b2e453eca41bbafcd62ec68e30f9c5328b6f","observation_id":"9d935b03-d3ab-47a7-9c6d-74efc9df2911","resolution":{"observed_at":"2026-08-06T21:47:14.591969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23532","last_updated":"2025-06-30T05:44:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T14:27:16.799169Z","submitted_at":"2025-06-30T05:44:14Z","title":"GViT: Representing Images as Gaussians for Visual Recognition"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":28},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2506.23532."}