{"as_of":"2026-08-07T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d228b309387d4075c79f0e144cfa0b901b5d57ef8c06734794b3b40938f8cf4","coverage":[{"denominator":126,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:36:14.803899Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03471/citation-record","integrity":"/paper/2608.03471/integrity","json":"/paper/2608.03471/citation-record.json","paper":"/paper/2608.03471"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:13.860317Z","title":"Aho and Jeffrey D","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:13.860317Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:45793660772c4843ff096262197b96f8195937e283f7f6985ee3b5d4b60653aa","observation_id":"05c3162f-6d2a-408b-a95e-37f4b85049cb","resolution":{"observed_at":"2026-08-05T18:36:13.860317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:13.959326Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:13.959326Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:21cabb06c80defb408d25e3ea0eaf1c290ec7c712ed0e52bba6d4f963c49ea59","observation_id":"54b014f6-175d-4ef0-ba27-4cfce696f196","resolution":{"observed_at":"2026-08-05T18:36:13.959326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.095082Z","title":"Chandra and Dexter C","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.095082Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:b51130d11122d13dcfeea0eb581db51d289043a0c1e3d3e16213306c5820b485","observation_id":"d24b2112-894a-470e-99b2-a8be3dc11edc","resolution":{"observed_at":"2026-08-05T18:36:14.095082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.196479Z","title":"Scalable training of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.196479Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:5f7f8ff6399910c29d51cace0b382b1a2da03600027b858efaaf339758ae1019","observation_id":"e1cba9e6-bf5b-4dab-ac21-6ff082c2e4d4","resolution":{"observed_at":"2026-08-05T18:36:14.196479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.252169Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.252169Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:342c439fb0aa25c253695451d42df652abadb2de489ef087f4a2836fc2685e73","observation_id":"9d888703-ce66-42ba-8600-8e289b2e8f2c","resolution":{"observed_at":"2026-08-05T18:36:14.252169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.318273Z","title":"Tetreault , title =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.318273Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:2158f8a909b6f81090f7073c7e7deb930c690324ef206efe6b997de373a21a36","observation_id":"333c3386-ae19-455e-a7eb-5d862dd416f1","resolution":{"observed_at":"2026-08-05T18:36:14.318273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.373855Z","title":"A Framework for Learning Predictive Structures from Multiple Tasks and Unlabeled Data , Volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.373855Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:4ca8b95f159855a3d8e9d909c21c995aedd7e776555ed14d6c16a1fe2308f0d7","observation_id":"5ecdbba9-8f5a-455e-8374-c08784fc8301","resolution":{"observed_at":"2026-08-05T18:36:14.373855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T18:36:14.439009Z","title":"arXiv preprint arXiv:2306.15195 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.439009Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:12e1ebed361ae7f93bf0d36e8c7c88aae2d3b8239fcf0668c7893d245c3acad2","observation_id":"19e70131-1cf2-4559-861a-fa854be07c75","resolution":{"observed_at":"2026-08-05T18:36:14.439009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.515588Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.515588Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:283e08a514027870abefbb9922ad0f49daacdc48584dbd0d676aa61a344a6c07","observation_id":"13e70be9-86e7-4f0b-9090-4a0540bd7953","resolution":{"observed_at":"2026-08-05T18:36:14.515588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T18:36:14.543800Z","title":"arXiv preprint arXiv:2306.14824 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.543800Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:945773a5341032e3c8608d656b16c4ea837533926293a0d0e1be1fbf7e36a01b","observation_id":"fe1fd85f-c79e-45e3-a8fb-a1e07ca46600","resolution":{"observed_at":"2026-08-05T18:36:14.543800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.547050Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.547050Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:27e1c95fd8b8d3c6f825a2f247ce5b8a5c303968a693b56ab3e22a8a8662fffa","observation_id":"6ecee1bb-f700-4674-92f2-7e1b14877597","resolution":{"observed_at":"2026-08-05T18:36:14.547050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.550050Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.550050Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:be6cf0fc46336e0b073f84f464690c96169e6a06977318a615b1e8a6ef773cc8","observation_id":"93b98021-1470-4af8-b933-706a2d89beeb","resolution":{"observed_at":"2026-08-05T18:36:14.550050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.552467Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.552467Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:52fdb14b54b6a0cfc636ae3d6e5e710b136d51b6729bc438756e5b72c93a2ef1","observation_id":"0060fbc9-b1ff-4999-bb98-47fe00d1b609","resolution":{"observed_at":"2026-08-05T18:36:14.552467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.555084Z","title":"3D Gaussian Splatting for Real-Time Radiance Field Rendering , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.555084Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:71c58949888141513a680f3ba020fbb7dcfd921fbd3e6f4a539769ec324f21cb","observation_id":"09c5f823-f13d-4697-bae8-673e8e01f5d9","resolution":{"observed_at":"2026-08-05T18:36:14.555084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.558285Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.558285Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:cb1b04c8b9c7f6e5710bf9496034c4e3ea89bd9c9742fca8f502c9425f476437","observation_id":"f75d8397-0c6d-40a0-9657-20bec030ab9e","resolution":{"observed_at":"2026-08-05T18:36:14.558285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.560960Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.560960Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:4a00509777933a252efe2a6c0c86c03c5da5b2965bfd0d5092797eb9d302d7b4","observation_id":"9172e7a4-c935-4a31-a021-a0ecefe775ab","resolution":{"observed_at":"2026-08-05T18:36:14.560960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14249","last_updated":"2025-06-23T08:10:31Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:01:32Z","title":"CLIP-GS: CLIP-Informed Gaussian Splatting for View-Consistent 3D Indoor Semantic Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14249","snapshot_observed_at":"2026-08-05T18:36:14.563725Z","title":"arXiv preprint arXiv:2404.14249 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.563725Z"},"links":{"cited_paper":"/paper/2404.14249","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:bd7070b3672ae6208cb0e8d5915dee22fd9c4d21270550e5aece0b98d21e9247","observation_id":"0e933b49-98d6-45a8-a97c-b8415e87b4c3","resolution":{"observed_at":"2026-08-05T18:36:14.563725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.567052Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.567052Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:0d727bc893869184074aae72c08c0f6ceb4c93da52b87b1e9a984165a7cb88f0","observation_id":"dedc46c5-2812-43f0-b4f0-8dbfd93f988c","resolution":{"observed_at":"2026-08-05T18:36:14.567052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.569863Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.569863Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:8b6cbaded377ca5fdfd18ee0082fe832177f5a46d151a10db70491762454b057","observation_id":"fa306d27-4251-4715-aaa6-1fc6ca4d0f77","resolution":{"observed_at":"2026-08-05T18:36:14.569863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.572930Z","title":"European Conference on Computer Vision (ECCV) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.572930Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:bceaf245ef69d74156435086e23f29487c0c83bd2a6b86d8216f736ee7b32bfa","observation_id":"2c2f5c4f-b80b-4733-b35b-96be2ef67995","resolution":{"observed_at":"2026-08-05T18:36:14.572930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.575502Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.575502Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:2a8a8216e9afcd6cbb0d691228732f99e1a53104d41464d44a06f0a24cf69866","observation_id":"eb9f62f0-d8cf-47f1-b969-695855e7bd9e","resolution":{"observed_at":"2026-08-05T18:36:14.575502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.577966Z","title":"2024 , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.577966Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:b2a054c3a5a9057672e17074b77255ad106a9845f8a0a1c96a424faf5a6c9a41","observation_id":"6832af4a-1904-4a6c-b94a-abd91115b37d","resolution":{"observed_at":"2026-08-05T18:36:14.577966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T18:36:14.580950Z","title":"arXiv:2304.02643 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.580950Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:f5ed87cca6cf262aaf2c3bd2a227f9cc72dbcd383355b60b1f0fd2d8c41bd51f","observation_id":"d5724fae-a287-4852-a469-4fa6814f76e5","resolution":{"observed_at":"2026-08-05T18:36:14.580950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.584356Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.584356Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:af1d03a35153a9a4e501d03884e5c6edd3dfa800c8ed8e76e0e2e984d4d764ba","observation_id":"b500cd3e-e284-4f18-8053-eeebd9576da8","resolution":{"observed_at":"2026-08-05T18:36:14.584356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-05T18:36:14.587342Z","title":"arXiv preprint arXiv:2303.05499 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.587342Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:b68cedb66d61e3e92d2b0b3112d6fe29c9c0eb56074a1c3cff21b51507f59c0e","observation_id":"984530ff-1746-4615-949f-21ff8e1d4765","resolution":{"observed_at":"2026-08-05T18:36:14.587342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.590589Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.590589Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:880356502f865bd8ab1b6720fdd2664c9c08c745d6726a5300fb1ce2f524ff4a","observation_id":"5d1f6b00-ad32-41d2-938d-f4420549b662","resolution":{"observed_at":"2026-08-05T18:36:14.590589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.593499Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.593499Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:90194bbd80c7cb6f0e193258cba2e00e6a2fbe8efa54f1d1c1582c0bb8ce0ef9","observation_id":"d6bfdac7-4e3d-409b-9f2c-aa1a4128443e","resolution":{"observed_at":"2026-08-05T18:36:14.593499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.596518Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.596518Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:17de30a8053afbaaf917a613fba9883ef545ca6b424a03f5d0d1da1fc0003bc3","observation_id":"21519a13-8ce4-4d64-a9ef-96a0e804d476","resolution":{"observed_at":"2026-08-05T18:36:14.596518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.600646Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.600646Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:58555602874df8ffb946139bedaa386060f6d3f40ada77484cdd20878dbab7f8","observation_id":"94b22ef0-efd1-4705-bda1-9631af4c04d8","resolution":{"observed_at":"2026-08-05T18:36:14.600646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.604110Z","title":"International Conference on Computer Vision (ICCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.604110Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:0c89f04cbc06c2397c418a3fb750cda7b6500a14d488f6226dd0cc6cbf38e8be","observation_id":"607df9cc-1ebd-4889-87bc-b7ad7a3aed2e","resolution":{"observed_at":"2026-08-05T18:36:14.604110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.606971Z","title":"Proceedings of the Winter Conference on Applications of Computer Vision (WACV) , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.606971Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:82d08f985d5f9f5ab857f4d9ce52c3b6a9728b101e5a69e5684f3031b11122b8","observation_id":"b5c5d949-c060-448d-a15f-5b2eb42f02ca","resolution":{"observed_at":"2026-08-05T18:36:14.606971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.609915Z","title":"The Thirty-eighth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.609915Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:5a6bba7a01a2b083527f2f96259aebe3cec72a7eb5587d0e3bcd0ed447ebe571","observation_id":"639fe5a3-eeb7-4c38-9e67-a2fa34fa97bf","resolution":{"observed_at":"2026-08-05T18:36:14.609915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.612453Z","title":"ECCV , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.612453Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:a04293dcc62fea88391c11d0352cd179ca3c672c6babcce3ff1d326803768b64","observation_id":"44dac702-e502-4f95-a393-5a72d52e4649","resolution":{"observed_at":"2026-08-05T18:36:14.612453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.19290","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.609237Z","title":"arXiv preprint arXiv:2411.19290 , year=","venue":null,"work_id":"e65b40f0-953e-40de-8ab2-fe2549011e75","year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.615057Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:e8dbbb4c88a8e1797fc759ad369baa09f76b8d22762faabb370754c908508c76","observation_id":"f2003e9f-a638-4613-94fc-0efffcd7fc79","resolution":{"observed_at":"2026-08-05T18:36:15.614687Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.617805Z","title":"2023 , journal=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.617805Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:428b5e49d657345c377b7b61a8ee98e00f21ea82357494f7f1c3c2f5bfb81e38","observation_id":"d7b81250-a476-4678-83cf-68ccfad85164","resolution":{"observed_at":"2026-08-05T18:36:14.617805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.620365Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.620365Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:84965b6fd11e4cc0a9c1f5ce7ca51f95a9f7fac0d6462a682eb340cfef701b60","observation_id":"f9fbc4dc-e079-4fe4-908d-9a74b9fa5fd5","resolution":{"observed_at":"2026-08-05T18:36:14.620365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.623197Z","title":"European Conference on Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.623197Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:b4875fc53ba0b1a408904ed229ec8908f7de89d559f28bff8143bc3a4aceccca","observation_id":"04d26ee5-0f5d-4e2a-bd3a-a7043358822c","resolution":{"observed_at":"2026-08-05T18:36:14.623197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.626283Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.626283Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:df4eed5fbec0976bf60858b276010a6efdd074e389ee186bed79c399fe7746e9","observation_id":"ad32a23b-1cd0-4256-b70e-d247a3fb2570","resolution":{"observed_at":"2026-08-05T18:36:14.626283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19615","last_updated":"2024-03-28T17:32:58Z","snapshot_observed_at":"2026-08-03T13:03:45.248447Z","submitted_at":"2024-03-28T17:32:58Z","title":"SA-GS: Scale-Adaptive Gaussian Splatting for Training-Free Anti-Aliasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19615","snapshot_observed_at":"2026-08-05T18:36:14.629252Z","title":"arXiv preprint arXiv:2403.19615 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.629252Z"},"links":{"cited_paper":"/paper/2403.19615","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:bc0c6c94ee5f5dfd614adc027d7e93b822f322dabd465974079f0d7de4a797ad","observation_id":"e0d42a2c-33d2-4bf7-a3e1-49e9be20809e","resolution":{"observed_at":"2026-08-05T18:36:14.629252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.632341Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.632341Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:c5ad95adccdd408ffbe8689c158e3cecdf8ef8e7873118646297f9e42e1a0c9d","observation_id":"091b3332-70bb-4c2f-a77c-a7835605fceb","resolution":{"observed_at":"2026-08-05T18:36:14.632341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.635230Z","title":"2025 , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.635230Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:6661c4cedbad1b4b5ba289255eda878c268542b702cabbd5a5299f69cbe23194","observation_id":"20accd26-1e80-4a13-8e8e-ba456773966f","resolution":{"observed_at":"2026-08-05T18:36:14.635230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.637847Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.637847Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:5a420e892e283d48b5248d0a2036c6893be184f735c753932701f964075916aa","observation_id":"d66a3beb-9366-4ccd-beed-63afae58a40a","resolution":{"observed_at":"2026-08-05T18:36:14.637847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.640344Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.640344Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:a751d8fc7ff9ffd9ee813f43647c410cefbc6749c85e1391167f8611fc1f667f","observation_id":"97dd1e0a-499e-47fc-a135-c206b607a10b","resolution":{"observed_at":"2026-08-05T18:36:14.640344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.642886Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.642886Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:c23e01051840c85e8e9a14e6929fcb696327cfa41ee4e613345c5065a461e00a","observation_id":"0f239f91-c7d0-4aaa-9cf5-f6cdb6bb98ee","resolution":{"observed_at":"2026-08-05T18:36:14.642886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.645821Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.645821Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:5873281d736a50f8606e2b0535bec38f054f04e68ba73361ba9bde3184718cbd","observation_id":"0b97ad58-2bb4-4be4-bc0c-03521e7d6af9","resolution":{"observed_at":"2026-08-05T18:36:14.645821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.648836Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.648836Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:79e0649d30bfabd3a82d49a4ee16c5176a805709f4ebadcf4c21aeea21aeea08","observation_id":"89e7ba27-0e36-48a3-8d8e-8f7beea3dc2a","resolution":{"observed_at":"2026-08-05T18:36:14.648836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.651545Z","title":"and Millis, Bryan A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.651545Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:4887ff080480351cced1a958d2f5f11ab55cdde64459a10760772aed473e97a1","observation_id":"b080ae90-66c8-4bb5-b7ba-b3131b353c18","resolution":{"observed_at":"2026-08-05T18:36:14.651545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.654342Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , month =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.654342Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:88c51978f3bb0e08f1ac9dd07386e4575934d8c83d36b9ef4504658c118ef600","observation_id":"d03b04aa-19b3-4476-a555-a8eb0852b2fa","resolution":{"observed_at":"2026-08-05T18:36:14.654342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.656929Z","title":"European Conference on Computer Vision (ECCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.656929Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:544f37fb00509821a7ae80a915d6fabfc2f31ae71e50063b5f013379018c57ed","observation_id":"cd210cab-5328-437c-922e-a5153215639b","resolution":{"observed_at":"2026-08-05T18:36:14.656929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.659368Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.659368Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:0a164668ce6244b3474c61c01e50c61505f42ddd736bad3c8e37aa14b86b6008","observation_id":"b5124f8d-946d-4508-8edd-33cc19b7bd0d","resolution":{"observed_at":"2026-08-05T18:36:14.659368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.661779Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.661779Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:fbf3af3d8730bb0c7ed8c389358e174a5bfeba22c94f035466ab7e4b660b76ae","observation_id":"4180f029-f831-4143-8cef-3c835b974ad8","resolution":{"observed_at":"2026-08-05T18:36:14.661779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.664285Z","title":"and Tancik, Matthew and Barron, Jonathan T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.664285Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:70069a9679a3b6983382cb5b8bc6f9b5f99cca7094a701290725eff0a5e53250","observation_id":"a72e51cc-7dad-49ed-966b-a34af6a55d21","resolution":{"observed_at":"2026-08-05T18:36:14.664285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.667144Z","title":"ACM Trans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.667144Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:cc88273cc319051dd93b941959f7a493e0cdf2a187e079d788f9d14cc8d34ba5","observation_id":"165fb722-f1b0-40b7-9b84-12fa6262e611","resolution":{"observed_at":"2026-08-05T18:36:14.667144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.669705Z","title":"and Kowalski, Marek and Johnson, Matthew and Shotton, Jamie and Valentin, Julien , title =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.669705Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:ad4a3a3d35234db253c7f422b2864953d5a27ac7639381ac8f25e41df04d1b74","observation_id":"50a05ee8-ec97-47e3-9315-13f644972de3","resolution":{"observed_at":"2026-08-05T18:36:14.669705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.672877Z","title":"2022 , booktitle=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.672877Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:d0cc9b65b0ca5a98ec26e7e114217feea48af161ae3c01cdc3ebd0eaa1eeaaca","observation_id":"46c85408-9cda-4be3-8888-11c8b0c280a3","resolution":{"observed_at":"2026-08-05T18:36:14.672877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10275","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.396796Z","title":"2025 , issn =","venue":null,"work_id":"91d25ab6-cbc9-40c9-90f6-e18acc729a1e","year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.675502Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:80e30b73205328a8cb20f3035c528cbc5c7f82734625e5ee3061a55e484e32b7","observation_id":"a5e66d65-a3fe-400f-a6f9-4e2c3e920718","resolution":{"observed_at":"2026-08-05T18:36:15.401488Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.678610Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.678610Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:edb67ca848e58fb51d5bbd3239dd6636d652a2d5acac2e9351fd6d3035b54e7e","observation_id":"5ca604eb-c6a7-456b-8e45-2e91a36338b7","resolution":{"observed_at":"2026-08-05T18:36:14.678610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.681520Z","title":"2024 , isbn =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.681520Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:3d9a73b1fe0d1c73cd2ca969812d67deb04257f427ceaa38b041e9f02cc1d91b","observation_id":"9b9832d0-d9eb-4629-b234-047e630a6212","resolution":{"observed_at":"2026-08-05T18:36:14.681520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.684278Z","title":"ICCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.684278Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:9da5bce0544ef0811ec2ee680ccb00ac98548edc435cb1670d13a6145bcab30a","observation_id":"ff7a1039-ca97-4ef8-805b-69ba98a64c69","resolution":{"observed_at":"2026-08-05T18:36:14.684278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.686842Z","title":"Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.686842Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:ca885449517d360c19ef5a48a93ddd27865639fc269403d9b7ae32f4f319a838","observation_id":"1e290908-5103-486b-8dda-340095c2e9f1","resolution":{"observed_at":"2026-08-05T18:36:14.686842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.689405Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.689405Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:f4c92ab2c278255592b834fc3be3c180b60d77c5095365142503075962b1f5b2","observation_id":"274061cb-60d2-4eef-9e09-e4971b900e96","resolution":{"observed_at":"2026-08-05T18:36:14.689405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06908","last_updated":"2024-04-08T16:16:56Z","snapshot_observed_at":"2026-08-03T17:14:02.563149Z","submitted_at":"2024-03-11T17:00:27Z","title":"FreGS: 3D Gaussian Splatting with Progressive Frequency Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06908","snapshot_observed_at":"2026-08-05T18:36:14.692379Z","title":"arXiv preprint arXiv:2403.06908 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.692379Z"},"links":{"cited_paper":"/paper/2403.06908","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:387151cc4d375eeac79cffe0d826bb75399851d51f049861cd08c71a6203b0c6","observation_id":"125db4cc-6fca-4220-b9a6-8b5d32753da2","resolution":{"observed_at":"2026-08-05T18:36:14.692379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:16.059636Z","title":"ECCV , year=","venue":null,"work_id":"d22d4a5d-e807-4c5a-a1db-4d99e0e65ec5","year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.695922Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:bf394bd02b9333724352d0b73c4ae409206b45a06c0ac47c4c401b5d7b84708e","observation_id":"f8a09337-e6e1-4722-8b2c-42a3fd0eb80d","resolution":{"observed_at":"2026-08-05T18:36:16.062246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:16.049876Z","title":"CVPR , year =","venue":null,"work_id":"84636a73-8469-4440-9bb9-7abb1abe4293","year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.698691Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:d219877f44cfbbf7211db86fcf04e35ec145ac8287840969229e0a0d11a946b2","observation_id":"a0c77da9-fa0a-4add-a4b0-7ae9c2034270","resolution":{"observed_at":"2026-08-05T18:36:16.053120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:16.040421Z","title":"2025 , eprint=","venue":null,"work_id":"a8931663-1cdb-4b18-b7c9-b4c095b77cd1","year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.701451Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:c2d91171a4dcf0ef6d11447b3e0e805d6f5cdf3972c8c94d6444dfb4339ec75c","observation_id":"87e49cbb-908c-4931-b09e-4238afe500e1","resolution":{"observed_at":"2026-08-05T18:36:16.043449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17898","last_updated":"2024-10-17T07:11:31Z","snapshot_observed_at":"2026-08-03T23:05:42.089043Z","submitted_at":"2024-03-26T17:39:36Z","title":"Octree-GS: Towards Consistent Real-time Rendering with LOD-Structured 3D Gaussians","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17898","snapshot_observed_at":"2026-08-05T18:36:14.704072Z","title":"arXiv preprint arXiv:2403.17898 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.704072Z"},"links":{"cited_paper":"/paper/2403.17898","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:b82b7093a805898164ecb449c0add2eca5f95cce04f365944fd34f785941a6a1","observation_id":"d9013983-e860-438e-8046-3f37bb35fda1","resolution":{"observed_at":"2026-08-05T18:36:14.704072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.707311Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.707311Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:3ef7af2b6932441c6e4421789b21aa323cdf484e134b2850962b827cf34435f9","observation_id":"edcf8857-984e-48d1-bb2d-3671ecad3910","resolution":{"observed_at":"2026-08-05T18:36:14.707311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:16.024117Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"6b84978b-13d3-42f5-b78d-06e5b2b8ed53","year":2022},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.709994Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:24c708b69d2d286bc71bb8d9e1a48175653e9e98cd21b1f58f5281450d147759","observation_id":"9796b80f-975e-4142-ab68-eb575f672958","resolution":{"observed_at":"2026-08-05T18:36:16.027668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:16.013666Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise , year =","venue":null,"work_id":"45fcbade-9cff-4a29-8280-4c14e46b78bb","year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.712561Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:3100c727d125cf73be1f8317016814597e5e46ecc147f67f41b5a09d050a40d7","observation_id":"863a96d1-c9ab-44a2-bd5d-20c10f828aa7","resolution":{"observed_at":"2026-08-05T18:36:16.016845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.715458Z","title":"doi:10.21105/joss.00205 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.715458Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:77e76043d024ba26ed8e75d9c47970938bf2f2d3a0346fbdc0e8360dd62519bd","observation_id":"1003449b-e1fc-4887-82a1-a746218ebc59","resolution":{"observed_at":"2026-08-05T18:36:14.715458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.718636Z","title":"Xu and Jun-Mei Song and Mingchuan Zhang and Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.718636Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:65cc91788d9a247477c6deeb3c8320d609af8ecfe4569615f1b97ad5884d1224","observation_id":"299134e9-7c70-4c1d-81f5-0f28527118df","resolution":{"observed_at":"2026-08-05T18:36:14.718636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.721367Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.721367Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:9eb62bb15c5f673f72a1a7a570d6f9ed228dc2a85cdd3672f48be8c5bfca6eda","observation_id":"a12cc7d4-d603-455f-b5ee-dc8af1939765","resolution":{"observed_at":"2026-08-05T18:36:14.721367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.723902Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.723902Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:0474980e452e484ac345eb8eb4721635f0199a251b65d21572b1ec644daa5269","observation_id":"85b4120e-510a-4779-83d3-e98bfcbcf2dc","resolution":{"observed_at":"2026-08-05T18:36:14.723902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.726271Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.726271Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:2eb87adac86a26fa9d5ca733c9c2ac1c9f550d2b7c08fc875cc02e74480b8b36","observation_id":"ec5dca0e-6adc-46f2-8424-8c4b712f10f9","resolution":{"observed_at":"2026-08-05T18:36:14.726271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.728848Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.728848Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:c3891652240c00e6e4ee3074ee8a771cf19dcc326a01733404b38fbe82554e71","observation_id":"45c5bfd4-edd2-419c-9810-8fc85b943616","resolution":{"observed_at":"2026-08-05T18:36:14.728848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-07T04:10:34.426874Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-05T18:36:14.731592Z","title":"arXiv preprint arXiv:2506.10967 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.731592Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:b14c664ee10ceb181c278747ca81faa3c04cd0cfcf77c76779bd45e10c243e1a","observation_id":"9355748a-d097-48c7-a5bc-667d093bcbcd","resolution":{"observed_at":"2026-08-05T18:36:14.731592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.970726Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , year=","venue":null,"work_id":"fdf2ccd2-46f6-44fd-b491-e7f9e4037fb1","year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.734354Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:5ac57bccfb772d5bc32b702168c078c68a417dadaf959e5c817c3fc8d3a5db16","observation_id":"edd1b9e8-2c5c-4a53-8c4f-9068b2169152","resolution":{"observed_at":"2026-08-05T18:36:15.973991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19930","last_updated":"2025-08-27T15:21:58Z","snapshot_observed_at":"2026-08-03T23:42:29.864142Z","submitted_at":"2024-11-29T18:42:28Z","title":"On Domain-Adaptive Post-Training for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19930","snapshot_observed_at":"2026-08-05T18:36:14.737043Z","title":"arXiv preprint arXiv:2411.19930 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.737043Z"},"links":{"cited_paper":"/paper/2411.19930","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:8206269b9b3291bc0a3e288361a5719649f91efc3a4a3bdf8daf2b009cde2f3a","observation_id":"f9bb392c-f221-447c-84e3-f9fdb1c63606","resolution":{"observed_at":"2026-08-05T18:36:14.737043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T18:36:14.741007Z","title":"arXiv preprint arXiv:2412.05271 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.741007Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:27c951a3e6f4c7012db99995b18670444d9c7374a1f0f3cd41a4967c5f6fd791","observation_id":"d2108742-3e95-426e-b50b-3dace0d1c5f2","resolution":{"observed_at":"2026-08-05T18:36:14.741007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-05T18:36:14.744181Z","title":"arXiv preprint arXiv:2411.10442 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.744181Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:7a4bc7a1f9dfeb1973996cf4afba6fec15327b7a2d2d53735ee6544b7008f892","observation_id":"67f09ea6-a15b-4325-b152-6bb155e95d75","resolution":{"observed_at":"2026-08-05T18:36:14.744181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T18:36:14.746975Z","title":"arXiv preprint arXiv:2404.16821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.746975Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:6adbf52b656ecab94b23a9c9a33baef7e275a88f6c4f3474b2c5a191f3aeaceb","observation_id":"5320eee2-ef43-45af-8062-96e8f15dea71","resolution":{"observed_at":"2026-08-05T18:36:14.746975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.749734Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.749734Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:1cf04f6ce3e3eeddcdc974e5e31a7bda89c132cc58e4bc1aa2b1ac8e49d09a41","observation_id":"4f915a16-4597-48ef-bd90-e0ed70cf8307","resolution":{"observed_at":"2026-08-05T18:36:14.749734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.955364Z","title":"Dynamic-","venue":null,"work_id":"4c47106b-85a3-4137-b6f5-c9399ecd6224","year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.752396Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:58de19287b3cd3e8568c5d6d0cadc0b88c3547f00f5e21c231fd2217b5aea5f7","observation_id":"de2133fa-493e-4bf3-b9c8-67d500387708","resolution":{"observed_at":"2026-08-05T18:36:15.958426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.945398Z","title":"2025 , eprint=","venue":null,"work_id":"83379a33-343e-4f38-bdcb-29cd73250f6a","year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.755072Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:f10f576cc1363c6da7a5b24750c92bbcb9eeaf36552e7dd7fdbdc444615f5497","observation_id":"d3a55338-94bd-4959-9b15-74fe5f20232f","resolution":{"observed_at":"2026-08-05T18:36:15.948870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T18:36:14.757890Z","title":"arXiv preprint arXiv:2308.12966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.757890Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:c54b02eced93753530011250b0790825d9fc232f1ba534a50db0a713561fd28c","observation_id":"1ae8f730-c647-437e-b9e9-cad3c2c62aaf","resolution":{"observed_at":"2026-08-05T18:36:14.757890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T18:36:14.760712Z","title":"arXiv preprint arXiv:2502.13923 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.760712Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:c514e1e415b6c276639d18b949893c5f9195eecb108a2f5549d56bc0ee3a286c","observation_id":"73b433f7-57d6-4b69-b6af-9ca0be0fd714","resolution":{"observed_at":"2026-08-05T18:36:14.760712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.763796Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.763796Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:9ba7327056e399bbb60519cab5c0014fa72a185d6047b77b9de46adc2b2b7521","observation_id":"afd57f44-22ec-41bb-a7f5-47a8b0314b96","resolution":{"observed_at":"2026-08-05T18:36:14.763796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.766290Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.766290Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:716411ddf4cf261aef75fd0ea971bf31c4dfa20b6059577db02f41ae55d9a668","observation_id":"3d73370b-643c-4655-b2c4-db090aa72b50","resolution":{"observed_at":"2026-08-05T18:36:14.766290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.922705Z","title":"2025 , eprint=","venue":null,"work_id":"526114aa-9d61-44e2-8c88-1c18eb7d75c9","year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.768777Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:5b487350937af7fc57b39872cb367bf8003d6145e44ba661cf73768e709f19da","observation_id":"d0f6e653-8f73-445f-91a5-3f87ae7d70b9","resolution":{"observed_at":"2026-08-05T18:36:15.926067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.911833Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"60048508-386e-4c50-8a04-e970664630ce","year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.771571Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:e88534f7e9a8c94b2aa2153964889eadc7ec72e9f3e5c30d971ce1a61b3875a7","observation_id":"adefc786-89ee-4e48-bbbb-ad08ff67ff98","resolution":{"observed_at":"2026-08-05T18:36:15.915470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.901911Z","title":"2025 , eprint=","venue":null,"work_id":"a183644f-5224-477c-b023-f9db615c980b","year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.774269Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:80314a4260e897381617d738c63790980a7317fc2077f477eb8e6b12416fa963","observation_id":"ccf344dc-7e06-4fbf-b026-e43eac6e8ac8","resolution":{"observed_at":"2026-08-05T18:36:15.905571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.891542Z","title":"2025 , eprint=","venue":null,"work_id":"85d534f5-3761-4104-9498-5ce8140216e9","year":2025},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.777014Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:caf735226d124b5173a3623cd87e103f08ca2651226f5f40a5cad233617e7e61","observation_id":"ebffcaf4-9bfc-43b7-8efa-d03e60dfa5cf","resolution":{"observed_at":"2026-08-05T18:36:15.894685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.779510Z","title":"LLaVA-NeXT: Improved reasoning, OCR, and world knowledge , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.779510Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:60e77de2d5ee43a42fc24d0dfd42a4ca57f4c9415e5c1aedf02c3934f918b60e","observation_id":"57d321ba-38ea-42a0-a613-11e24ea3cdf2","resolution":{"observed_at":"2026-08-05T18:36:14.779510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.782277Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.782277Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:4779a410f53e1a49febe32fb67987ffd1f3a9954f717c797cef9ca85dd6f985b","observation_id":"43cc1454-4748-4029-bfdb-d54a198905e3","resolution":{"observed_at":"2026-08-05T18:36:14.782277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.785722Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.785722Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:b65da02f1fac3ff907a3e3f9640cbb690b5bdb7c1e2e6e564f91ec495697f1ff","observation_id":"e2713971-5904-4f97-a970-10538dc241ee","resolution":{"observed_at":"2026-08-05T18:36:14.785722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.788960Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.788960Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:0a1709d495e5d1772aed49b5b503ddf109c2b885b1e7a1d34f2c69308dbf3a1c","observation_id":"db3f4a05-53d7-4565-b7cc-9aff9ca5ccd6","resolution":{"observed_at":"2026-08-05T18:36:14.788960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:14.792785Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.792785Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:2cd196c5840e1f793fb08e175dc8b01021616fd1b269fe5bae069db44bffb365","observation_id":"5dce6c34-6f76-4223-b228-c530208476d6","resolution":{"observed_at":"2026-08-05T18:36:14.792785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.850547Z","title":"and Murphy, Kevin , title =","venue":null,"work_id":"286dc7f9-cc05-4b9d-bbf3-42c8acb48071","year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.796456Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:fec402fd2278a3997cab55b5558d4b760744bd0f06bbfcace481e123a2c3a8e0","observation_id":"701deacf-b1bf-4335-9f6f-40bf15d92b80","resolution":{"observed_at":"2026-08-05T18:36:15.853345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00329","last_updated":"2025-08-20T19:09:06Z","snapshot_observed_at":"2026-07-06T20:44:49.893232Z","submitted_at":"2025-03-01T03:29:02Z","title":"ABC: Achieving Better Control of Multimodal Embeddings using VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00329","snapshot_observed_at":"2026-08-05T18:36:14.800007Z","title":"arXiv preprint arXiv:2503.00329 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.800007Z"},"links":{"cited_paper":"/paper/2503.00329","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:14a3933a889944436552862b24df8c9dae7901f4fb424b582a4afc67d122d9b0","observation_id":"4f30652e-612e-4a03-bc1e-603f0945d86a","resolution":{"observed_at":"2026-08-05T18:36:14.800007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:36:15.840661Z","title":"and Mildenhall, Ben and Verbin, Dor and Srinivasan, Pratul P","venue":null,"work_id":"66970f7f-7bbc-432a-b4b9-8354c72d9462","year":2022},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.803899Z"},"links":{"citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:c33452743bf251c1c0e577650c31b8f5c0c84873682ea0a7b4a0ddb31b37f2b2","observation_id":"910fdb95-56c3-4b7d-b6b4-a054da3c06db","resolution":{"observed_at":"2026-08-05T18:36:15.844615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:47:00.469990Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":84,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":126},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 126 outbound references and 0 inbound Pith citation observations for arXiv:2608.03471."}