{"as_of":"2026-08-17T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83ead3fa176583efff12b457e8e1b07db30a09d4249d741375d733de147d96e0","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:01:23.882872Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11131/citation-record","integrity":"/paper/2506.11131/integrity","json":"/paper/2506.11131/citation-record.json","paper":"/paper/2506.11131"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.729466Z","title":"Zerowaste dataset: To- wards deformable object segmentation in cluttered scenes","venue":null,"work_id":"c74fb107-ed37-4c5f-b0f1-58c9a849cb9d","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.694098Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:21fb20061f0722e0575ee8baaf1387ce47e37d92613a41c8d4ed2b6a8ee6ada8","observation_id":"1e509b39-0717-4dce-a7b4-5ced0adbec71","resolution":{"observed_at":"2026-08-07T05:01:24.746199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-07T05:01:23.698370Z","title":"To- ken merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.698370Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:de075f064b0c3816ede6dc2580dafa0c37a6367e06c394791cd3bac98595f412","observation_id":"28594f12-b209-49ab-a85a-cfe51ce3f4f5","resolution":{"observed_at":"2026-08-07T05:01:23.698370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.652292Z","title":"The eccentricity effect: Target eccentricity af- fects performance on conjunction searches.Perception & psychophysics, 57:1241–1261, 1995","venue":null,"work_id":"730f591f-30ef-4a53-b29a-26d0605f0a8a","year":1995},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.702224Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:e960fecaadc7011680d44de5b732687879f34121888d99493b8eef8d5e4952dd","observation_id":"c86c28c2-8ee7-40b4-9a06-65874c14c5fd","resolution":{"observed_at":"2026-08-07T05:01:24.694667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.636882Z","title":"Pelk: Parameter-efficient large kernel con- vnets with peripheral convolution","venue":null,"work_id":"f40bcc23-1ff5-44c3-a9f3-072ce9af986d","year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.705985Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:f42bca5c7114382ff89fdffab88fa1483dd4baf59fa3a0d36d4712dd8b5573da","observation_id":"e2183c98-8fcb-4a6c-bb8d-b4cd06db1fb2","resolution":{"observed_at":"2026-08-07T05:01:24.642470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.623487Z","title":"Diffrate: Differentiable compression rate for efficient vision transformers","venue":null,"work_id":"251ba3a5-3a25-48eb-b412-f30c5791d1b4","year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.709324Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:df7b0dd3f712904ed5ad4553cba1413c7517ac2cf7121e13f81a2712e9e8c910","observation_id":"55063883-09bd-41a8-89dd-fafbd792858a","resolution":{"observed_at":"2026-08-07T05:01:24.627947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:23.712548Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.712548Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:8de71afa551128a1d8ab11ca42bdf5b939d1b5eb01de8f6fb1ac7954ddcdef2a","observation_id":"9b378b04-b665-45ab-af7e-f1ae93f46f5b","resolution":{"observed_at":"2026-08-07T05:01:23.712548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.602647Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100.International Journal of Com- puter Vision, pages 1–23, 2022","venue":null,"work_id":"952b6c37-e44e-4d4a-a30d-b3c00c90ab55","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.716082Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:43f12318e858793739ac19c08bf6f575d9143885f0fdf44043ae366b7a031042","observation_id":"8327ace9-0161-4fb0-914d-af88c483025c","resolution":{"observed_at":"2026-08-07T05:01:24.607128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-07T05:01:23.719371Z","title":"Vision transformers need registers.arXiv preprint arXiv:2309.16588, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.719371Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:60fdeea3c7d18166ac57753d454d08a5eb1db1c43f692cfe7a6b9fab744deda6","observation_id":"55363477-3f56-4009-bd58-67cd24293673","resolution":{"observed_at":"2026-08-07T05:01:23.719371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.589033Z","title":"Epic-kitchens visor benchmark: Video segmenta- tions and object relations","venue":null,"work_id":"1cb208b3-04dd-4833-af5e-b92041dceec4","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.722720Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:6df6ea89380a2054720dfdad195517e5ef75100dbdd6818122c898a2bbe27063","observation_id":"eaf99e91-6ff2-42c3-a664-fb632d5f4745","resolution":{"observed_at":"2026-08-07T05:01:24.593588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.570837Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"0a2d8c54-827e-4240-a2bf-3662122bc214","year":2009},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.725866Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:05750da5668832e537afa6282c616816bf54766f26ef87f9e4078b29072191ae","observation_id":"0f531688-f6f3-4537-9755-c3accd759b1f","resolution":{"observed_at":"2026-08-07T05:01:24.580040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T05:01:23.728704Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.728704Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:37f558112a593497405f15a2fd16c3a2eac53aab94e6739822fbc310728befa3","observation_id":"5bd0c6c2-48f7-406f-8e90-cb51c855634a","resolution":{"observed_at":"2026-08-07T05:01:23.728704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-08-13T14:52:21.014234Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-07T05:01:23.732463Z","title":"Project aria: A new tool for egocentric multi-modal ai research.arXiv preprint arXiv:2308.13561, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.732463Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:07183fac206dc413211745c1c1a663acfba1e3dd672efa4b7d572793aa733c29","observation_id":"72ea821b-b086-4d6d-b65a-2f06aad9f9ab","resolution":{"observed_at":"2026-08-07T05:01:23.732463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.541101Z","title":"Adaptive token sampling for efficient vision transformers","venue":null,"work_id":"1242a42e-d9c9-4420-ad3e-aa8e1f6faa41","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.735627Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:dda1057945766e4562c7771297a2532064e8da9003c4da974b48d5024e3baf96","observation_id":"2b6c4ab8-f20c-40e8-8e11-08ac62ec1bf0","resolution":{"observed_at":"2026-08-07T05:01:24.554245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.490064Z","title":"Instance segmen- tation for autonomous log grasping in forestry operations","venue":null,"work_id":"8fbd75f5-c33b-4998-bb7c-c9d0f9f83a14","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.738525Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:d9ce91ebcba91c8c1d1194f978aac1c1f18d022f1c9e8ab4b384e340a3e06f01","observation_id":"21c265b8-1918-4a76-8f95-917f683ff375","resolution":{"observed_at":"2026-08-07T05:01:24.515908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.454158Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"c2dcc134-8f25-4b4d-9a50-994c80d30b8b","year":2016},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.741588Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:9cc1754d246d21eb22325195978351b3a10fed4d35dcbc61d222cb8cbfbdefc3","observation_id":"99a98a1c-017e-41cd-a25a-d4f760767f8c","resolution":{"observed_at":"2026-08-07T05:01:24.463612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.441380Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"6bcc332e-b2e3-46f9-806e-d121e5dd1b40","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.744538Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:0b70ead6f0c23a81d961f4cf8fed7e51f399eb7742917ee5a2846fd37237b7f2","observation_id":"18b36cfc-202c-4303-b830-5c8676a3cd26","resolution":{"observed_at":"2026-08-07T05:01:24.445343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00238","last_updated":"2024-07-01T15:54:17Z","snapshot_observed_at":"2026-08-16T15:27:43.591854Z","submitted_at":"2023-05-31T23:18:21Z","title":"Bytes Are All You Need: Transformers Operating Directly On File Bytes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00238","snapshot_observed_at":"2026-08-07T05:01:23.747349Z","title":"Bytes are all you need: Transformers operat- ing directly on file bytes.arXiv preprint arXiv:2306.00238,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.747349Z"},"links":{"cited_paper":"/paper/2306.00238","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:748d0a9120c313c75fd07742198025156e739ab2174fb2623119af17bc8f9620","observation_id":"73d796ab-7a26-4cb7-a8bc-8af8e40e5868","resolution":{"observed_at":"2026-08-07T05:01:23.747349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14173","last_updated":"2022-10-02T19:59:49Z","snapshot_observed_at":"2026-08-16T18:21:18.375935Z","submitted_at":"2021-05-29T01:54:33Z","title":"FoveaTer: Foveated Transformer for Image Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14173","snapshot_observed_at":"2026-08-07T05:01:23.751062Z","title":"Foveater: Foveated transformer for image classification.arXiv preprint arXiv:2105.14173,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.751062Z"},"links":{"cited_paper":"/paper/2105.14173","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:3b432195e211ced6f31e14c2f7603157577df7aee2e40363f283efbd452d7a2b","observation_id":"40a1255e-c691-4dd0-81b2-330d8e2c0bec","resolution":{"observed_at":"2026-08-07T05:01:23.751062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T05:01:23.754450Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.754450Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:780c64f242449fc1791d82f9c53c04ea9f37c9be4230e3e572798fcae0365ec4","observation_id":"0fa90366-b06b-4c18-999a-852cc05fc66c","resolution":{"observed_at":"2026-08-07T05:01:23.754450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.429964Z","title":"Segment any- thing","venue":null,"work_id":"bc3561b1-73a5-4707-b973-2b6e75b86e44","year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.758293Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:07d4f0b89160e9a37e7181e3d4c04dbde192b75c447c61343368b0691c7186f9","observation_id":"8e62f6ee-dc64-4cb4-96a4-a8b2d340878b","resolution":{"observed_at":"2026-08-07T05:01:24.433749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.419111Z","title":"Spvit: Enabling faster vision transformers via latency-aware soft token pruning","venue":null,"work_id":"47e4c4a8-5026-42af-abed-04a4a0d1615a","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.761078Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:f9dd7808a5f5585a1af1d22783cc694ad5f1cc58c1a317ee41e8a5f2218e9c08","observation_id":"c7db607a-ee3c-4385-8c74-e1c25ba8a50b","resolution":{"observed_at":"2026-08-07T05:01:24.422770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17217","last_updated":"2024-01-31T05:21:13Z","snapshot_observed_at":"2026-08-16T14:23:08.996320Z","submitted_at":"2024-01-30T18:02:44Z","title":"GazeGPT: Augmenting Human Capabilities using Gaze-contingent Contextual AI for Smart Eyewear","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17217","snapshot_observed_at":"2026-08-07T05:01:23.764359Z","title":"Gazegpt: Augment- ing human capabilities using gaze-contingent contextual ai for smart eyewear.arXiv preprint arXiv:2401.17217, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.764359Z"},"links":{"cited_paper":"/paper/2401.17217","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:e3dde5274a995b3e932a75ee43fdaf57c58232be6999d4130a2342e5bb72b3c7","observation_id":"9ca957d8-7dc4-43bd-9854-dd88108d4785","resolution":{"observed_at":"2026-08-07T05:01:23.764359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.407397Z","title":"Imagenet classification with deep convolutional neural net- works.NeurIPS, 25, 2012","venue":null,"work_id":"6e4ae14b-1d84-4e9d-9e8a-a3db01db1bb1","year":2012},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.767641Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:835f712d944cb49c8a290b6f4f2196813bab2a7e584db2ff96e0903980736cdd","observation_id":"590a6293-dc25-4f1d-9958-f665e0569fb0","resolution":{"observed_at":"2026-08-07T05:01:24.411540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:23.771069Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.771069Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:85b1aee1befd801b150b0313b8b8285be3e5986bf4dadc6e01882dac59e5ad18","observation_id":"63c6b7bf-c21b-49ac-a983-781244081ff1","resolution":{"observed_at":"2026-08-07T05:01:23.771069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.386611Z","title":"Efficientvit: Memory efficient vision transformer with cascaded group attention","venue":null,"work_id":"f61e6ce7-3ed0-49a0-ab21-c98652ece555","year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.774471Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:bc4715c6c8dc17b02d1506dfd7f048d2cf8cc7ab6305b6bef16034e6c502a0d4","observation_id":"36157df9-59b5-4627-a570-b74ea1f749c3","resolution":{"observed_at":"2026-08-07T05:01:24.390481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09905","last_updated":"2024-09-20T01:18:11Z","snapshot_observed_at":"2026-08-16T13:43:01.336372Z","submitted_at":"2024-06-14T10:23:53Z","title":"Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09905","snapshot_observed_at":"2026-08-07T05:01:23.777693Z","title":"Nymeria: A massive collection of multimodal egocentric daily motion in the wild.arXiv preprint arXiv:2406.09905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.777693Z"},"links":{"cited_paper":"/paper/2406.09905","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:0020ed1ae667ff3f3fd32527d22487f4e3837ac70445b8eab6d6a50f811e0f4c","observation_id":"084b4e53-0296-46e9-af71-b67bc7baa978","resolution":{"observed_at":"2026-08-07T05:01:23.777693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03860","last_updated":"2021-10-11T15:17:21Z","snapshot_observed_at":"2026-08-16T17:50:58.511440Z","submitted_at":"2021-10-08T02:22:50Z","title":"Token Pooling in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03860","snapshot_observed_at":"2026-08-07T05:01:23.781218Z","title":"Token pooling in vision transformers.arXiv preprint arXiv:2110.03860, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.781218Z"},"links":{"cited_paper":"/paper/2110.03860","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:63b8c4aa74f314b4573d6d020e2cdad0a3eb4f44b7b841b63e45d925433c02bc","observation_id":"788a1717-40dd-4ee4-8aa0-f37e6cdbb4a8","resolution":{"observed_at":"2026-08-07T05:01:23.781218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.373777Z","title":"Adavit: Adaptive vision transformers for efficient image recognition","venue":null,"work_id":"970ba642-a2dc-4c60-9cdb-eb3830c40007","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.785126Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:780b80d9e9a30587fa2f6428b218608541f9d39cabd0e5141683729977314b20","observation_id":"a7e9de63-7a8c-483d-a0e1-f877df98dc81","resolution":{"observed_at":"2026-08-07T05:01:24.377985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.361814Z","title":"Peripheral vision transformer.NeurIPS, 35:32097–32111,","venue":null,"work_id":"a79ecbe5-fdef-4810-8fef-5b1a09668ba9","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.788274Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:c545209833d69b442b18f0fcad9767ade9a10d513f4bbfb7e3d0e06d98fd10ca","observation_id":"4c17ce08-a961-4e2a-b3ca-24f2b5bde1e1","resolution":{"observed_at":"2026-08-07T05:01:24.365746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.348737Z","title":"Finely-grained annotated datasets for image-based plant phenotyping.Pattern recognition letters, 81:80–89, 2016","venue":null,"work_id":"e4dfd7e2-00b4-49b5-a86e-077c52d1b0c8","year":2016},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.791261Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:c867b62105f89b7a81629a683c232afc0b55c3e07154c175a1766af958243d84","observation_id":"f56ad5c0-676c-4893-aac9-98ab94bf32b6","resolution":{"observed_at":"2026-08-07T05:01:24.354346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.337795Z","title":"Rgb no more: Minimally- decoded jpeg vision transformers","venue":null,"work_id":"bb880c7f-1302-43fa-b175-c2d9abb0a73b","year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.794455Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:a5ccd61adebccc028d14668b43fa693c11b82d217630fe95b488de43990a990f","observation_id":"1235dc9c-c215-4930-968f-9f7b0e3a0247","resolution":{"observed_at":"2026-08-07T05:01:24.341396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.326000Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification.NeurIPS, 34:13937–13949, 2021","venue":null,"work_id":"429cd63f-4d1d-4ee6-b9fb-a8fdfc1328d5","year":2021},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.797553Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:3ffef614706ba79df53914c4a544f863ee514d5ffcf7c18f680ec2836102054c","observation_id":"cbf95ed2-4d45-4c90-a0bd-b8014a99c4cd","resolution":{"observed_at":"2026-08-07T05:01:24.329601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T05:01:23.800874Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.800874Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:e26923b957d8ec5ce9db6dc5ac232d27397c1c11896f15422e12ec3bee1d6580","observation_id":"69d40b15-99d7-4f63-8ae8-d2561eba0191","resolution":{"observed_at":"2026-08-07T05:01:23.800874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12015","last_updated":"2022-02-24T10:56:17Z","snapshot_observed_at":"2026-08-16T17:18:58.644497Z","submitted_at":"2022-02-24T10:56:17Z","title":"Learning to Merge Tokens in Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12015","snapshot_observed_at":"2026-08-07T05:01:23.804525Z","title":"Learn- ing to merge tokens in vision transformers.arXiv preprint arXiv:2202.12015, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.804525Z"},"links":{"cited_paper":"/paper/2202.12015","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:abcfa425332865091b142a8518412d68eb665d4953c7a3c379fa4837f96eba93","observation_id":"c65e594d-c154-445b-a67a-def22ddd5241","resolution":{"observed_at":"2026-08-07T05:01:23.804525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04570","last_updated":"2022-03-09T08:15:14Z","snapshot_observed_at":"2026-08-16T17:15:57.043690Z","submitted_at":"2022-03-09T08:15:14Z","title":"CP-ViT: Cascade Vision Transformer Pruning via Progressive Sparsity Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04570","snapshot_observed_at":"2026-08-07T05:01:23.807850Z","title":"Cp-vit: Cascade vision transformer pruning via progressive sparsity prediction.arXiv preprint arXiv:2203.04570, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.807850Z"},"links":{"cited_paper":"/paper/2203.04570","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:a6db8e01b2135ff699505fea2cb36ee0c69ed95d47a1c912495ce8be6def5da2","observation_id":"7ccae9cd-45a8-41a1-a6a8-b6cb26b7a985","resolution":{"observed_at":"2026-08-07T05:01:23.807850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04960","last_updated":"2026-06-04T11:59:03Z","snapshot_observed_at":"2026-08-16T13:11:56.955238Z","submitted_at":"2024-10-07T11:59:54Z","title":"On Efficient Variants of Segment Anything Model: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04960","snapshot_observed_at":"2026-08-07T05:01:23.811323Z","title":"On efficient variants of segment anything model: A survey.arXiv preprint arXiv:2410.04960, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.811323Z"},"links":{"cited_paper":"/paper/2410.04960","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:22f36b9adbe5d5d596b566030f275116322811b4df9e96d6350c841f655cf307","observation_id":"e8f10b38-f447-44eb-968a-3d3eaf864169","resolution":{"observed_at":"2026-08-07T05:01:23.811323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13359","last_updated":"2020-05-27T13:41:39Z","snapshot_observed_at":"2026-08-13T22:35:56.132004Z","submitted_at":"2020-05-27T13:41:39Z","title":"NDD20: A large-scale few-shot dolphin dataset for coarse and fine-grained categorisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13359","snapshot_observed_at":"2026-08-07T05:01:23.814417Z","title":"Ndd20: A large-scale few-shot dolphin dataset for coarse and fine-grained categorisation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.814417Z"},"links":{"cited_paper":"/paper/2005.13359","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:4f9ce2d5fb83c3688744be5e02c2970d1bf84a26a5731d9650cbfd65cc5368c2","observation_id":"d23f2a49-6e4d-41b8-84f9-aba653abed04","resolution":{"observed_at":"2026-08-07T05:01:23.814417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:23.818098Z","title":"Neural discrete representation learning.NeurIPS, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.818098Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:78a912dcd3ddeffb6210d131d26b0b9f498f8b72d59b2d50e8987fe0e5ae09f1","observation_id":"43bd1eec-cba5-4ced-a584-1a7f911a7b8d","resolution":{"observed_at":"2026-08-07T05:01:23.818098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06736","last_updated":"2024-05-20T22:58:52Z","snapshot_observed_at":"2026-08-16T14:35:50.072543Z","submitted_at":"2023-12-11T16:04:22Z","title":"SqueezeSAM: User friendly mobile interactive segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06736","snapshot_observed_at":"2026-08-07T05:01:23.821808Z","title":"Squeeze- sam: User friendly mobile interactive segmentation.arXiv preprint arXiv:2312.06736, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.821808Z"},"links":{"cited_paper":"/paper/2312.06736","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:d5fda0ba0bf383a97d7c180626a7651d92841f36f70cfffb3a05c00dee35edf0","observation_id":"b4ca801e-802b-431c-a17c-b8c84bc54fda","resolution":{"observed_at":"2026-08-07T05:01:23.821808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.306172Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":"c20c3e0d-7d8e-4aa1-81d9-82def6b20a66","year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.825145Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:44d502a23983d3e29ac9f7c4d0a15c4adf610c975aa97ec47cda5494c4b5c2d3","observation_id":"39280563-a8b6-411a-928b-0b8736568912","resolution":{"observed_at":"2026-08-07T05:01:24.309971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08368","last_updated":"2025-02-02T19:28:27Z","snapshot_observed_at":"2026-08-16T13:10:32.262792Z","submitted_at":"2024-10-10T20:54:15Z","title":"ElasticTok: Adaptive Tokenization for Image and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08368","snapshot_observed_at":"2026-08-07T05:01:23.828275Z","title":"Elastictok: Adap- tive tokenization for image and video.arXiv preprint arXiv:2410.08368, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.828275Z"},"links":{"cited_paper":"/paper/2410.08368","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:aac747233ed935dde637bf765381cde09c1d53105117b60e35e1430436ef2cbd","observation_id":"4fb11bf9-fcfe-488a-bb6c-46e94179d6f8","resolution":{"observed_at":"2026-08-07T05:01:23.828275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.295723Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":"c39a3047-721d-45ac-819c-4e92716c3f04","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.831259Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:aeb2eaad50e44d64acf8d2b6d56fbc36e61c3ee769b19f2efc844c205937654f","observation_id":"d5c30b82-a863-4e20-8dfa-befadddf50fa","resolution":{"observed_at":"2026-08-07T05:01:24.299277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.285190Z","title":"Woodscape: A multi-task, multi-camera fisheye dataset for autonomous driving","venue":null,"work_id":"753deb8b-bdd7-437e-98fd-accdfce301c7","year":2019},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.834300Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:164b67d177dae4eca237c6f8846e58ea4aba3c68b58cf5a859e7f77f1c652b87","observation_id":"0e845d06-82ed-4ee2-8822-c956a82a55ec","resolution":{"observed_at":"2026-08-07T05:01:24.288980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-07T05:01:23.837602Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.837602Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:2cf854cbf28974b5959b16f0127a6390213b9da0a958546b8a01eb2e7432a5c2","observation_id":"51258c3e-8c81-49a3-8ae8-791671ac755e","resolution":{"observed_at":"2026-08-07T05:01:23.837602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07550","last_updated":"2024-06-11T17:59:56Z","snapshot_observed_at":"2026-08-16T13:44:02.831519Z","submitted_at":"2024-06-11T17:59:56Z","title":"An Image is Worth 32 Tokens for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07550","snapshot_observed_at":"2026-08-07T05:01:23.840987Z","title":"An image is worth 32 tokens for reconstruction and generation.arXiv preprint arXiv:2406.07550, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.840987Z"},"links":{"cited_paper":"/paper/2406.07550","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:498d5cf7f54ed69b6d754238f83ea9debae240a1f0d07adcb6412ee67a675ab3","observation_id":"1406d1ef-0d27-4c18-a42b-e0873baf7cbf","resolution":{"observed_at":"2026-08-07T05:01:23.840987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-12T07:11:05.316372Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-07T05:01:23.844273Z","title":"Faster segment anything: Towards lightweight sam for mo- bile applications.arXiv preprint arXiv:2306.14289, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.844273Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:ca7d25e5960a5fb9f27f3254bf34afe42d9c5039fe942ad798b7cdb39f21f93a","observation_id":"c971f6c8-29c5-4407-8401-1fe63677d38d","resolution":{"observed_at":"2026-08-07T05:01:23.844273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.274785Z","title":"Fine-grained egocentric hand-object segmentation: Dataset, model, and applications","venue":null,"work_id":"f1794e9c-2e66-4328-b082-2dfd600bafd2","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.847206Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:bfa125a58cae0c511e104be43acfe0f5eb16da4716a38a48adffd8571ed1f0d9","observation_id":"09b06f40-1aee-42b8-9c5a-6f73400cc95c","resolution":{"observed_at":"2026-08-07T05:01:24.278276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.264289Z","title":"Efficientvit-sam: Accelerated segment anything model without performance loss","venue":null,"work_id":"e2590296-a56c-4b37-9d44-b09822d1a779","year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.850081Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:4210a8f8e998d5141c831c999324e6c887f7104aab98942944d07d0f949d5b6e","observation_id":"13e08c05-b92e-4eb8-a142-e51cfd207e2d","resolution":{"observed_at":"2026-08-07T05:01:24.267838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-16T15:22:17.250833Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-07T05:01:23.853152Z","title":"Fast segment any- thing.arXiv preprint arXiv:2306.12156, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.853152Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:904c08cd7772ff84fad88a994a2a1b8d4285544b07a5d42fb906b83241807c16","observation_id":"e57b58ee-d1ee-4a3b-bb66-c6f4e81d541b","resolution":{"observed_at":"2026-08-07T05:01:23.853152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.252864Z","title":"Semantic under- standing of scenes through the ade20k dataset.IJCV, 127: 302–321, 2019","venue":null,"work_id":"c263defa-6eb0-4583-b48a-fa8057597724","year":2019},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.856235Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:d56346f8275829b43fd4da544c489e1cd3388642a1dc5a4183aa0b0e41bfccad","observation_id":"7ce1e0d3-1524-42d2-bd27-260cfd55224e","resolution":{"observed_at":"2026-08-07T05:01:24.256436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06660","last_updated":"2025-09-07T19:09:41Z","snapshot_observed_at":"2026-08-16T14:35:45.722490Z","submitted_at":"2023-12-11T18:59:52Z","title":"EdgeSAM: Prompt-In-the-Loop Distillation for SAM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06660","snapshot_observed_at":"2026-08-07T05:01:23.859111Z","title":"Edgesam: Prompt-in-the-loop distillation for on-device de- ployment of sam.arXiv preprint arXiv:2312.06660, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.859111Z"},"links":{"cited_paper":"/paper/2312.06660","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:5ffb92f5b0c9245c7d14bff2d0e39271ca70c072c7d501e314d180955c3d1249","observation_id":"4f101be8-ea3f-41fc-980f-1c44a8ac2330","resolution":{"observed_at":"2026-08-07T05:01:23.859111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.242943Z","title":"MAE Pre-training We pre-trained our foveated image encoders using MAE pre-training for 500K iterations","venue":null,"work_id":"3245eb62-6fc1-4d94-84e4-e4a19a870d74","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.862624Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:19931a01a5255ac5458a27030dcc91f43b0c86e8f09fa7ebd3260ec5efd6f079","observation_id":"9a6763cf-b739-4160-aff5-205b06f3fbe4","resolution":{"observed_at":"2026-08-07T05:01:24.246207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.231369Z","title":"Here we give a more formal definition of the parameterization of such a pattern","venue":null,"work_id":"6821ff0e-6886-46b1-a379-2dbc22e7b8b6","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.866031Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:f8b6cf47adc8c90e82cda91da20501912d170c3d1342152f3f08193759f83094","observation_id":"ed16bc5d-091d-4f38-bd2f-fd6573629003","resolution":{"observed_at":"2026-08-07T05:01:24.235663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.219049Z","title":"We plot the training loss curves in Figure 12","venue":null,"work_id":"44f8a2fe-c989-4294-bdb5-011afd5f2c92","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.870145Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:3a9662ba6bfd1cd17eadeabfaec330d739cd58f2ee94f9f1c32b47aad683ec21","observation_id":"47069a74-dd08-4d4f-8a35-60ad7cff6bd0","resolution":{"observed_at":"2026-08-07T05:01:24.223472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.207989Z","title":"Our foveation patterns exists in a high-dimensional design space, and each new pattern requires its own MAE pre-training","venue":null,"work_id":"2d972c2a-17ab-47a8-97d6-c1bdbf487fc1","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.873570Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:af63375675d4554e442dff190ec0bb08f5e09b5fda30c1ee3301df43149984bf","observation_id":"e45f3356-3b77-40e8-bd38-290c2a6498fd","resolution":{"observed_at":"2026-08-07T05:01:24.211826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.197070Z","title":null,"venue":null,"work_id":"71ef1a68-72c8-4132-9b21-3536f785e580","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.876636Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:64e8341e4419034b7c9e9ef275b875d0b87a2f1dc9c8182ca989a50c3ff95b73","observation_id":"813448ba-c64e-4019-a5c7-c23e2205b705","resolution":{"observed_at":"2026-08-07T05:01:24.200458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.186869Z","title":null,"venue":null,"work_id":"7eb9fdf4-01aa-46be-8738-9db04f5065c9","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.879791Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:82290e94c525ae827871e71f37c6d842fe1803a0b390f9c7bcbeaa20eb280f04","observation_id":"399a220f-faf9-4e66-be1f-94a640639ef8","resolution":{"observed_at":"2026-08-07T05:01:24.190238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.174287Z","title":"in computing FLOP counts for transformer architectures (c.f","venue":null,"work_id":"d9ce741e-7d9a-438c-83e5-2ee68d5b8c72","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.882872Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:01cce214e681b856ef23766c3bf4a5d4c9849031777bf4dfc9b98e59058e2777","observation_id":"51feced0-379a-438d-ba46-36a366146a89","resolution":{"observed_at":"2026-08-07T05:01:24.179128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:12:29.228430Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2506.11131."}