{"as_of":"2026-08-09T19:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42dcdd4fcdfb661c48f5e257d02e9ecbf28310cf37a54b7584d83bf4d34620fd","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:40.776768Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T06:02:40.158866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T06:07:22.539904Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"cited_work":{"arxiv_id":"2505.16993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16993","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native segmentation vision transformers","venue":null,"work_id":"3d615dba-1c33-432e-b263-42d6f705646c","year":2025},"citing_paper":{"arxiv_id":"2605.12491","last_updated":"2026-05-12T17:59:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T17:59:26Z","title":"Elastic Attention Cores for Scalable Vision Transformers","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:40.158866Z"},"links":{"cited_paper":"/paper/2505.16993","citing_paper":"/paper/2605.12491"},"observation_digest":"sha256:9602c684d607af0ad0d3b4b8c4153f4710953e9d99e3781cad68317e08552838","observation_id":"ade4aadf-4816-44a2-9198-566b2ec09f15","resolution":{"observed_at":"2026-05-13T06:07:22.541489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16993/citation-record","integrity":"/paper/2505.16993/integrity","json":"/paper/2505.16993/citation-record.json","paper":"/paper/2505.16993"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.491663Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.491663Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:31df2b3675b2847edccde141c1aa0b72d19d8bd08848b1c4b799141b54a66f0e","observation_id":"2460445c-9575-432c-a64a-35e294bcf3ca","resolution":{"observed_at":"2026-08-07T14:55:34.491663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:50.490369Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"5269942d-e456-4c4b-a0ec-ea83f49eaff4","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.575933Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:f63b9dd331a374649f3c7806b38220c5eb16613a7a8d0bb95a0208b7d96ae43d","observation_id":"39342ace-32b9-4815-9690-66756b5c6ab3","resolution":{"observed_at":"2026-08-07T14:55:50.558282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:50.375551Z","title":"Neighborhood attention transformer","venue":null,"work_id":"b2d0db65-5e14-40cc-ba58-0753c1e0e0eb","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.685306Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:8b1834336d337fe44a0c7acdd8d2dbab1859476fe3ebf682650a2bc8237b015b","observation_id":"f518c955-48b5-4dc5-a695-53331bd64673","resolution":{"observed_at":"2026-08-07T14:55:50.429716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.815187Z","title":"Backpropagation applied to handwritten zip code recognition","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.815187Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:c071ad639d5e5e389533c073a52d4fa294bd6c59be65313fcbee23e8e7fb07a7","observation_id":"969585b4-5aa4-4515-985d-81316a64135c","resolution":{"observed_at":"2026-08-07T14:55:34.815187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.922357Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.922357Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6a736e8a5445b3a292fed8122409e1644efd915431abb4b11b878b88b515f568","observation_id":"a9843379-0ad2-44e0-a301-20e7a7d3e85d","resolution":{"observed_at":"2026-08-07T14:55:34.922357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.010276Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.010276Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:c6845bd3510a8662094df6a27175dc3739c386368903c5b76abdb2773d87873b","observation_id":"da6f51d4-8ab3-42fd-99f6-aed459b366ac","resolution":{"observed_at":"2026-08-07T14:55:35.010276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.085000Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.085000Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:d108afe799bd96d0ad7087f8ce5a1a00db3a3a630325aa1f1c99ab365dce64ba","observation_id":"cdb95e00-622d-4ef2-8539-659d45743bd9","resolution":{"observed_at":"2026-08-07T14:55:35.085000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:50.202420Z","title":"FaPN: Feature-aligned pyramid network for dense image prediction","venue":null,"work_id":"2ae1f4a5-a487-4bac-95f9-a8594d09060a","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.224616Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:80a30bc535d04eb42eeb029d10949ae6f622e00c92b0eae9e376e28ea65890aa","observation_id":"991767dd-4efc-4e69-9305-9957da71bd7f","resolution":{"observed_at":"2026-08-07T14:55:50.262110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:50.047141Z","title":null,"venue":null,"work_id":"dd5f7907-3b5d-45f4-9a33-659ffce05ea9","year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.321961Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:46518b842b17b387b8d1524e555bd3bbd29b0c36910addf896d6c07b31313a85","observation_id":"ee282015-9ab6-4dc9-a550-1d84fc6a92af","resolution":{"observed_at":"2026-08-07T14:55:50.132482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.926057Z","title":"Clusterformer: Clustering as a universal visual learner","venue":null,"work_id":"80950b99-36a0-414c-a3c4-cb811014f6ce","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.479711Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:cdb90e9f0243b1a5e824320797adc8a37491971a13f9722cafa74a6086c3553c","observation_id":"3e5f1493-744d-47ed-934f-63537f47f13b","resolution":{"observed_at":"2026-08-07T14:55:49.967714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.813280Z","title":"Learning hierarchical image segmentation for recognition and by recognition","venue":null,"work_id":"5ad3cdae-e3e4-410e-ad5a-86a9dcd1d4c0","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.562953Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:dadf942556a4e81733929aaf2cd87d34ff31ff3cb9e4f94a5bc0e27b4def35fd","observation_id":"fa701606-54c5-4881-b075-b7c7e1865346","resolution":{"observed_at":"2026-08-07T14:55:49.870902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.689712Z","title":"Tcformer: Visual recognition via token clustering transformer","venue":null,"work_id":"0016b373-9e4e-48d5-892c-e4a2bee7aa21","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.643011Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:a9f5c12ab5720b5bb9924c7380b693e876e77f4e6f73e96c023f19bc06cc319a","observation_id":"15597a3d-7613-4f33-8943-a46cfd1b6687","resolution":{"observed_at":"2026-08-07T14:55:49.742996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.517038Z","title":"Schwing, and Alexander Kirillov","venue":null,"work_id":"0da441b2-4e05-491b-b14f-1b5234b46d80","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.735251Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:4704fd15d244a884b643bba12fe8d52f5e967d634981ebbf93695efdb32dca28","observation_id":"2d765e73-8eea-41de-9bc5-055e8bb36032","resolution":{"observed_at":"2026-08-07T14:55:49.604488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.333583Z","title":"Slic superpixels compared to state-of-the-art superpixel methods","venue":null,"work_id":"244d73fd-d6c4-4989-9a2f-b77dcc81be6a","year":2012},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.837086Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:5fdc898ad0a8522bb78fa88a3bdc2defe4d058b2c0d1872a78735e5492cf6deb","observation_id":"6f38e803-886f-4711-aeef-f7b547b01593","resolution":{"observed_at":"2026-08-07T14:55:49.402810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.144815Z","title":"Object-centric learning with slot attention","venue":null,"work_id":"de3caffa-2c73-45e1-b1d8-5130947d3a54","year":2020},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.935254Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:2aa1e0c8b31c2fef1379cca105f68d7a363bbf2c78f89d3e0dcd45c987383570","observation_id":"8bd76a18-d8a2-42f5-999d-27a3bca78879","resolution":{"observed_at":"2026-08-07T14:55:49.233922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.957401Z","title":"Mean shift: A robust approach toward feature space analysis","venue":null,"work_id":"5de298e0-feb0-4f54-a2dd-e5045569bbd9","year":2002},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.074370Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:62a1a0264a12f69fdb231f40a2192179f6927d0843cd7254e2930ca3209d43a8","observation_id":"2fa49496-b243-4745-a451-4f5bb7571d4b","resolution":{"observed_at":"2026-08-07T14:55:49.016911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.804676Z","title":"Felzenszwalb and Daniel P","venue":null,"work_id":"48d4d2c5-44d9-4e3d-9cfc-220217ed0964","year":2004},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.168668Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:94961ca5404ad12a0dacf53a0b763e12514456feb4a7a80c6f55cf57e753ea46","observation_id":"f1abbd73-3554-4b10-82bc-659c6ddb72ae","resolution":{"observed_at":"2026-08-07T14:55:48.853816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.626924Z","title":"Contour detection and hierarchical image segmentation","venue":null,"work_id":"74dffdb0-ce85-41e6-b918-bba4c1af4fb6","year":2011},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.279399Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:31a57e04ebb19a6cccec673e112d1105563bc84baed4b9beebefe8f939e3cb57","observation_id":"b6cc0892-2632-4d79-a46b-dea5645c87d8","resolution":{"observed_at":"2026-08-07T14:55:48.710783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.482630Z","title":"Seeds: Superpixels extracted via energy-driven sampling","venue":null,"work_id":"b8f7d252-cb37-4e92-8783-83d04d314733","year":2012},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.403076Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:c469fb5c4a9251dfca4b4806c455ad4d810c9e94e5224b7ee36fb358e81c9c43","observation_id":"6909a4cd-4635-4a9c-b02d-8368068fba64","resolution":{"observed_at":"2026-08-07T14:55:48.536144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.309349Z","title":"Semantic understanding of scenes through the ade20k dataset","venue":null,"work_id":"5119e17f-433e-4d68-a593-81b75d633876","year":2019},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.473035Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:85988ebb3189b472ada5cac47ccfb91bdc86118aaf06ddcc277437b0ffd1e1e8","observation_id":"6f8390d9-e7de-427f-ba63-7e7c1684f633","resolution":{"observed_at":"2026-08-07T14:55:48.395546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.150834Z","title":"Panoptic segmentation","venue":null,"work_id":"19326935-0da1-446a-b2a1-7163f1c078a5","year":2019},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.569923Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:c91f1b0a806c36b232c5bd5f404802523f0e245f213e2c363184a7d6c8d72a07","observation_id":"22559590-2a4f-410d-bdfa-744dd9271f2f","resolution":{"observed_at":"2026-08-07T14:55:48.202978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.693822Z","title":"Neocognitron: A self-organizing neural network model for a mechanism of pattern recognition unaffected by shift in position","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.693822Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1cd134b73413c73add4e40d9f7ffdcf80cf00665031d741a52fe66c422374284","observation_id":"cc44dad6-1121-4f2f-a77c-7b88b2bded88","resolution":{"observed_at":"2026-08-07T14:55:36.693822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.977913Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":"a3d4ad5e-d840-46e1-9224-c2e1465e67b1","year":1998},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.746616Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:cbda56b6218d06dcaf3edc2e28e4e4f0798f295821c18aa617b3a1dc18b91b66","observation_id":"60d9cf58-f5f8-4f77-9266-976677bb21c0","resolution":{"observed_at":"2026-08-07T14:55:48.038344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.825137Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.825137Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:4d02092f9bf066b83a1bb260895c987af36319bf536e10c526a2c0c8ec753061","observation_id":"11364c9b-1f78-438f-add2-63c1c7732b99","resolution":{"observed_at":"2026-08-07T14:55:36.825137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.922349Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.922349Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:5b327742c171423425fdb83a0620f1177fea697d83bbd8450ef1c5fbfb46e58b","observation_id":"edb1c32d-38b4-47cb-b971-d50f5cdb5fe7","resolution":{"observed_at":"2026-08-07T14:55:36.922349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T14:55:37.004068Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.004068Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:004590246257bd0fd939985ba0df7b7692ff8b4728d0a661e684a41f296c7806","observation_id":"0350cb82-c86e-4800-bd90-f7e8a3f9b611","resolution":{"observed_at":"2026-08-07T14:55:37.004068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.099662Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.099662Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:72e727094c2689f83ffa766d71d88ffb3fe6ce4302a92cd468c07ac6bcf3e3bd","observation_id":"9851423e-6728-49b0-a99d-6c901950ccb1","resolution":{"observed_at":"2026-08-07T14:55:37.099662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.749748Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"d0335ea2-cddf-4115-8144-8c6a19af3209","year":2015},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.172521Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1ab08a545588b5f36cde253093271b1d70bd6832db6decbdb908640ed8b7f903","observation_id":"8e70d7bb-005f-436d-adb4-ffaa0f5b9655","resolution":{"observed_at":"2026-08-07T14:55:47.850044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.571806Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":"5cc166e6-9392-4d56-a423-57aa1b751414","year":2014},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.259829Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6ff076049cecf1882e1a91597fef68fa6afdbe26fcc89da4650d03d1625dbc22","observation_id":"7296edd4-bfdd-41fa-b45b-d1ef3d797e07","resolution":{"observed_at":"2026-08-07T14:55:47.634897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.360904Z","title":"Fast r-cnn","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.360904Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:33f9b172c1b9b7eaa57fc1a108c57b780b58ca6128c12f99752331f61c2aec95","observation_id":"4617a109-394d-4a8d-b17d-2a6863660fa7","resolution":{"observed_at":"2026-08-07T14:55:37.360904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.466195Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.466195Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:baba5f1ccaaffbd60696c40302255816cb93386090b1b56f2a5c73bd180c7f55","observation_id":"abbb1278-5402-40c8-b8a9-a796dda25b68","resolution":{"observed_at":"2026-08-07T14:55:37.466195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.288304Z","title":"Normalized cuts and image segmentation","venue":null,"work_id":"1aebea02-3f2e-44a5-a4c6-be19eb82ec31","year":2000},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.548532Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6b8831bbcfc50b1c2c2f01bd97cb14c6790cf8ed6331ac64cc5f4855806980ac","observation_id":"e95186b4-c75a-4946-8c30-eb2aae10353d","resolution":{"observed_at":"2026-08-07T14:55:47.416823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.133838Z","title":"Multiscale combinatorial grouping","venue":null,"work_id":"e530d4a1-768c-4423-9aed-6eab75712972","year":2014},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.643606Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1c80cd8667412ac8e1065a81acd53e22e42443db440a7dcac3cab56934c9cce3","observation_id":"2a1bbe62-2422-4b2f-9320-d17f37cbd3cb","resolution":{"observed_at":"2026-08-07T14:55:47.198109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.913484Z","title":"Superpixel samping networks","venue":null,"work_id":"980203e7-41d2-4526-8679-dc3ebf723dee","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.702010Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:805a6dc7348442958c0dc4568b839e67032e08aecdba0ead9c0b29d6dec8b2b8","observation_id":"46dc9746-5865-474f-b668-83260ca4fe38","resolution":{"observed_at":"2026-08-07T14:55:47.016623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.706813Z","title":null,"venue":null,"work_id":"c5c1c820-3fce-484d-a062-f6da053ccaa2","year":1957},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.819714Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:a726fe285df3c3e54f79840c04b6867da01bd62694345782e64e3767a5edf059","observation_id":"abda8ddf-d305-4097-8a72-bf103965d096","resolution":{"observed_at":"2026-08-07T14:55:46.802461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.473125Z","title":null,"venue":null,"work_id":"6f3c1a19-1715-42b7-9e00-24add3d1d896","year":1967},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.930389Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:cdc6181a65b4d7566a904a97355a77134d595a34b0e8687c97a391d5b089015f","observation_id":"db5cc85c-a4f2-48a8-b46e-064f879dc9a9","resolution":{"observed_at":"2026-08-07T14:55:46.557896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.311672Z","title":"Unified perceptual parsing for scene understanding","venue":null,"work_id":"277b7f9d-c122-4c54-ac1b-4a4ba16893ad","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.018959Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:ca1a81b4ac206de9079a0f8ad9b76243b39374e1818fbef653f6d09e0d5f5612","observation_id":"9eca3a2d-053d-4021-b61b-b205ef653898","resolution":{"observed_at":"2026-08-07T14:55:46.374569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.127601Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"37a9e10c-a4ab-42dd-bca3-0e5092e18bb9","year":2015},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.112464Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:895cf39d9d5f605b116dce209672518c01d5c5f03f957343b1bc11b1d79dad20","observation_id":"58de59c6-c80f-492b-a683-8e12dfa77e14","resolution":{"observed_at":"2026-08-07T14:55:46.201278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:38.182246Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.182246Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:22d8b85b841d1385214fe29581b78037226c46d27b76626ab202ae97c9c9d31b","observation_id":"e4bb2b64-dfeb-44b8-8a9f-32b9a46018a4","resolution":{"observed_at":"2026-08-07T14:55:38.182246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.922183Z","title":"Le, Yun- Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"2ebab3c2-a0f1-4f99-8188-25fd4afc4f97","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.254570Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:5a1d55834813feb15ecac1cb9604f85de35c3f7255c9cd6d2c1597d9a84ccd39","observation_id":"051e48ba-726e-45b9-b577-5958b6803ef4","resolution":{"observed_at":"2026-08-07T14:55:46.027620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.764642Z","title":"A simple framework for text-supervised semantic segmentation","venue":null,"work_id":"d3e614c5-829b-45da-8318-05c32bf2f31f","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.330391Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:18e469586bcaf3b5888bbbd5a707ba07219fed70ede939f18bc2f0f740c22d16","observation_id":"4c5dfd3e-7978-414e-93c7-3a0c2cfde865","resolution":{"observed_at":"2026-08-07T14:55:45.829111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.601406Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"e3739120-9e9c-4bb5-a5ba-bdf711d8ef54","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.424956Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:3e2333ae12c66f1180f868cfeb2fa065e22af7179d3ff1f109936c0b00718338","observation_id":"522dc38d-724f-4e3d-bd7d-5badc2072f75","resolution":{"observed_at":"2026-08-07T14:55:45.691037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08981","last_updated":"2021-03-30T08:20:34Z","snapshot_observed_at":"2026-08-09T09:33:13.219731Z","submitted_at":"2021-02-17T19:15:53Z","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08981","snapshot_observed_at":"2026-08-07T14:55:38.530639Z","title":"Conceptual 12m: Push- ing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.530639Z"},"links":{"cited_paper":"/paper/2102.08981","citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:ad6cc146651af881526e1cf8d8b6335ecd16b3b4440aa108fa8b74b6b937ae3d","observation_id":"4b1d9c74-8136-437f-94e8-736a37685071","resolution":{"observed_at":"2026-08-07T14:55:38.530639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.434729Z","title":"Redcaps: Web-crawled image-text data created by the people, for the people","venue":null,"work_id":"69034d4c-7d94-4912-a43c-89eb32b2d4a9","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.622568Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:02b2ab324938361893cf7fdef8d121e0064751cf6059e1eab0c96f3332a17309","observation_id":"7663898a-73b5-447d-912e-d66af4100685","resolution":{"observed_at":"2026-08-07T14:55:45.509767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.211099Z","title":"Learning to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":"d8b4124c-2489-4751-98a5-cea7d614fa25","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.698678Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:fbebed86e4e3951f37ee6fc6261b502d1ffadd0390401e2895403522ba0c5ab8","observation_id":"421a5750-7cb4-45b2-844d-c2068675156c","resolution":{"observed_at":"2026-08-07T14:55:45.310461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.015526Z","title":"Everingham, L","venue":null,"work_id":"6f389626-36ff-4540-8d02-7c7aebe9b4fb","year":2010},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.790705Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6c6ed0fb51930af3c6ddba9c702de8a91d04cd278541e0b3f66769d60c537823","observation_id":"e6c0e57e-0842-4104-93aa-39c716c4ff09","resolution":{"observed_at":"2026-08-07T14:55:45.134327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.812408Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"955372eb-b2b5-4346-861d-25a4fbd50d2f","year":2014},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.870638Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1812133ad56040cf09ae52c0fe4f6ad2748dfa2b7a40e865b21ac234192a9315","observation_id":"72274a1a-d26c-4238-8e16-a879ee05c245","resolution":{"observed_at":"2026-08-07T14:55:44.877729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.671913Z","title":null,"venue":null,"work_id":"f986d792-6c51-49b2-bc46-dd3a049f4df4","year":2014},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.933552Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:14a8cd4a03482cb841d33409a976c14f2f8ca34227eeeecc89f0aacce5b0fd42","observation_id":"12ff2374-85bd-42dc-a2a2-3e24c9307cc2","resolution":{"observed_at":"2026-08-07T14:55:44.748497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.450357Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"ad275879-6904-4e1f-b0f1-4502ebc94b8d","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.012943Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:74ab5c01ac7a842df2b6685056cb5b10035674847ef8b3fd4b12d00ede7a0ebf","observation_id":"0863d82c-10c4-4e67-9774-4d4e6d0519a9","resolution":{"observed_at":"2026-08-07T14:55:44.550601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:39.058264Z","title":"Cordts, M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.058264Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6812857de9838d94ca77214497f39f38fce5946741239feef4e1479ed0c3d910","observation_id":"45573f47-e3d0-44e4-acab-46e74982d378","resolution":{"observed_at":"2026-08-07T14:55:39.058264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.249888Z","title":"Open- world semantic segmentation via contrasting and clustering vision-language embedding","venue":null,"work_id":"2de55433-1c1b-4bd3-a4a8-1b31c3e192e1","year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.128618Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:7a0439dd953fe2e9aa9a074837772e03f0d0447e321856318cb0b58015ac1a08","observation_id":"971d4e1d-0360-4075-8853-572bf21cf678","resolution":{"observed_at":"2026-08-07T14:55:44.340556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.091107Z","title":"Segclip: Patch aggregation with learnable centers for open-vocabulary semantic segmentation","venue":null,"work_id":"e2905972-49f4-47db-afd8-dbd61cbe6c06","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.200859Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:8b5ac22e13892096b195f370069fccf5d65770c6a248e7461335bc15f7f144f8","observation_id":"c5829d93-cf5c-4493-a113-a528c55e49b4","resolution":{"observed_at":"2026-08-07T14:55:44.151077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.905064Z","title":"Image-text co-decomposition for text-supervised semantic segmentation","venue":null,"work_id":"2c6d2836-7e0b-4e44-92d1-0db42b1e1903","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.283083Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1c9c35eac1b6ee5456a38967816c2261450118a3eb0992efdc39404a311be128","observation_id":"e922457d-570b-402d-829f-1ed192d4d53b","resolution":{"observed_at":"2026-08-07T14:55:43.994656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.709898Z","title":"Viewco: Discovering text-supervised segmentation masks via multi-view semantic consistency","venue":null,"work_id":"ad5c8e42-6603-4feb-aac3-5f8eace3c57a","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.361768Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6992f2179cd5bdb5fc8ee44ab8cd8af4778f5a569ddbdefcf93a5c165fe630b2","observation_id":"fab32581-2094-4638-8719-105837d4e6f9","resolution":{"observed_at":"2026-08-07T14:55:43.799254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.531308Z","title":"Rewrite caption semantics: Bridging semantic gaps for language-supervised semantic segmentation","venue":null,"work_id":"60d5d938-c6bb-4c92-a087-7ed7f416edd8","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.421485Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:82655ee66c2da0e028f736deeeba8d636a69c05111527834b742c56bc0af8b14","observation_id":"8fc88444-f9a1-41e5-9db4-72413e568c66","resolution":{"observed_at":"2026-08-07T14:55:43.625993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.393304Z","title":"Uncovering prototypical knowledge for weakly open-vocabulary semantic segmentation","venue":null,"work_id":"34679ce6-f54a-4735-8f7e-d1cc22fac22b","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.494191Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:be27aea47084337a06de464b1242353d9f32dedb5adc8aed8116a1374766b7c2","observation_id":"fc8b093b-d0cd-47b1-a17d-aabcc22eb2f9","resolution":{"observed_at":"2026-08-07T14:55:43.458392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.231424Z","title":"Efficient inference in fully connected crfs with gaussian edge potentials","venue":null,"work_id":"55679ae6-5096-4564-a0ff-ee9af7d9fb16","year":2011},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.625717Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:623bc3ab541e52bbc17578e43cbd198851cef21935f6603b208d2d9d5c0b9fa6","observation_id":"6ca380dd-fdbd-4b8c-ad63-df2fcdf1a52a","resolution":{"observed_at":"2026-08-07T14:55:43.313744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.121098Z","title":"Single-stage semantic segmentation from image labels","venue":null,"work_id":"52d5bf93-e869-4250-9cf6-deaeee4cb226","year":2020},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.659409Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:e9b5b891ef878995c12a18da4f8a2427a54569b818625275fefa73aee9360f1e","observation_id":"10d3c55d-06db-4062-bd14-7ef921ee45ea","resolution":{"observed_at":"2026-08-07T14:55:43.172338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.963012Z","title":"Vmamba: Visual state space model","venue":null,"work_id":"6ead9292-f8fc-463e-8c4c-8801f59e5e28","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.699866Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:3634365bad4cd2001c4b19a57f3d5fcdb502819f94d68da6c3a34e2fa94d914c","observation_id":"c961662f-da5d-4207-8db6-5a18fcc46496","resolution":{"observed_at":"2026-08-07T14:55:43.049455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.812313Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"1c01dfd6-7078-410b-b0c7-acec76f40613","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.776032Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:8db36e10ae3377113eade5e521637cf62e06bf88aaba622706ffbbff898a0723","observation_id":"dec6cc42-45af-4d31-ac73-3f8f589fe156","resolution":{"observed_at":"2026-08-07T14:55:42.871618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.707495Z","title":"Panoptic feature pyramid networks","venue":null,"work_id":"76e3329c-1e04-4fb7-ba4a-530d8c8c0414","year":2019},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.859502Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:5cde51cbfed3eb33853405d9f5bd6985eba93073a17ff64bfc7fb8eb420ce422","observation_id":"67f73f93-4e98-4907-9f6a-301595fefb4f","resolution":{"observed_at":"2026-08-07T14:55:42.750426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.523384Z","title":"Segmenter: Transformer for semantic segmentation","venue":null,"work_id":"fb33ae30-6951-4689-8680-0020e887c414","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.938874Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:3ae317ba3b52c6c6b13b2e6203a2e1b740620fbaa4c457cce6447d31c803a4ae","observation_id":"d62ce440-cb23-407d-a27d-786cc8396158","resolution":{"observed_at":"2026-08-07T14:55:42.618951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.399654Z","title":null,"venue":null,"work_id":"a01719bf-d746-48ab-90b6-1c5da218076e","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.973272Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:d45e467b1fd3238a358ac60f2f4838c1e362666070ff0657d1a568eef5310a3f","observation_id":"40dc5a72-0625-40f4-8cc7-38b435006774","resolution":{"observed_at":"2026-08-07T14:55:42.424557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.270771Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"ec225d5e-2263-4e8e-af7f-0326df531a86","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.084480Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:2858611ca51a864476690fa04c821f3366dd533da40b3b503a6582d7fd623ab1","observation_id":"a3bbe0f1-d2f1-4079-87cf-a4b174ad51be","resolution":{"observed_at":"2026-08-07T14:55:42.334089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.127099Z","title":"Self-attention with relative position rep- resentations","venue":null,"work_id":"1bae3666-723a-4e26-accf-e305d3a98915","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.167748Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:2e651f01c068e999e7bf6a5794e6b284617994b2e16906d6735c57c9f36c122b","observation_id":"1f78a695-9c15-4dbe-9b6a-30f1560e0474","resolution":{"observed_at":"2026-08-07T14:55:42.192849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.008184Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"299f92ad-6280-408b-a16c-63e9355a5753","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.218252Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:d706ad5b4a1153a81d5e76719520966e7bcad6f77fe7dc2ee26368763d35d7c6","observation_id":"8c28d6ac-aa0c-4cb7-813d-7735c818d99a","resolution":{"observed_at":"2026-08-07T14:55:42.054391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.888152Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":"e8c896a8-031d-43d8-abc2-ab35388a4039","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.261863Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:3afc586f5afcde4ec48055c342484535d7d2bdc0da41237f8bf8e0d4d1603994","observation_id":"437ba9f9-51cf-4272-8968-749e3242de6f","resolution":{"observed_at":"2026-08-07T14:55:41.934310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.695739Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"6fc20e13-7128-48eb-849f-79b4728931a6","year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.305574Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:7128f84e9aed6264efcbc745e85d656693271d93962a015532c7654147509b20","observation_id":"bdfafc2b-bed4-4ea6-a779-5aaf230de942","resolution":{"observed_at":"2026-08-07T14:55:41.770603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.531799Z","title":"Faster neighborhood attention: Reducing the o(n^2) cost of self attention at the threadblock level","venue":null,"work_id":"884b23ea-c53c-4d87-9fb2-03766bafe430","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.399294Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:0b261346d8af1fa30b6d13befc17a33b7d5201a763927f014d38fa0e172ea86c","observation_id":"3f1e26f5-c66c-415e-bb6b-d6518d192254","resolution":{"observed_at":"2026-08-07T14:55:41.619633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.403275Z","title":"Training data-efficient image transformers; distillation through attention","venue":null,"work_id":"70e474f2-d4f8-4888-83df-d58c930a2468","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.479785Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:c8e101da8deb74ba9e0b0f90458a9203562583fd4cd33fc2d63276925770d6bf","observation_id":"14e5460f-1f9e-4ca8-8d8e-684f2faea1de","resolution":{"observed_at":"2026-08-07T14:55:41.448153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.302009Z","title":"Weinberger","venue":null,"work_id":"0630a6c9-eaf7-4214-a826-ed643a21fb6e","year":2016},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.578280Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:88b3f3de7421ccf82191961682d29fb23f14b965f783b0630ed77ed7ddc6db3e","observation_id":"8a207c97-2d2a-41fc-b4af-80f60be67ba7","resolution":{"observed_at":"2026-08-07T14:55:41.352789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.119249Z","title":"Empirically, we observe a negligible decrease of downstream classification and segmentation performance, and a significant increase in speed","venue":null,"work_id":"8acf015a-a787-47ab-a6fc-7b0531ecd4af","year":null},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.651143Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:3fa281c65446fd0b60e298d12072328f4c27b6111a3da5fb178e87a2fb1a3ebd","observation_id":"bfa2a9c9-10fd-4b9b-a662-2997cd397c59","resolution":{"observed_at":"2026-08-07T14:55:41.181944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.004742Z","title":"An image of {CLASS }","venue":null,"work_id":"af1e2725-5053-42f8-938e-c58b6abc956d","year":null},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.725910Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:94562616205809a1010893bce2df75175edf9903a9abfcbada70e2114535b69f","observation_id":"92b5b608-2b35-4808-89b9-bab8545c1252","resolution":{"observed_at":"2026-08-07T14:55:41.063393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:40.879805Z","title":null,"venue":null,"work_id":"20c130d6-5d96-486a-81c9-65b7a3b6bdba","year":null},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.776768Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:352a331a5a930777c2d412b46877c337532f97c65f261568422054da28a2c339","observation_id":"e32f542a-07bc-4bab-b9e8-6397532cc881","resolution":{"observed_at":"2026-08-07T14:55:40.952338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:39:48.542662Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 1 inbound Pith citation observation for arXiv:2505.16993."}