{"as_of":"2026-08-17T12:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b535ef93d44697cccd5967cb10a9550cc10b0891ab700638e2a32028f37e3d2f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:19:36.748237Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:06:30.418964Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-12T14:31:37.035027Z","title":"Revisiting referring expression compre- hension evaluation in the era of large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-14T10:19:04.189589Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T14:31:37.035027Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2411.15296"},"observation_digest":"sha256:dffcd495ca3efb6e19a56d09ac3810df3798ba0e673bb83b9637de0b7ff16213","observation_id":"c015d103-93b1-4f2f-8f8d-eeb9445e64a7","resolution":{"observed_at":"2026-08-12T14:31:37.035027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-11T16:36:34.710222Z","title":"Gary Chan, and Hongyang Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09936","last_updated":"2024-12-13T07:51:32Z","snapshot_observed_at":"2026-08-14T08:49:52.498585Z","submitted_at":"2024-12-13T07:51:32Z","title":"CaLoRAify: Calorie Estimation with Visual-Text Pairing and LoRA-Driven Visual Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:36:34.710222Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2412.09936"},"observation_digest":"sha256:5af1ef1dfd894fec6335befb7994ea389fceff60e38f85fe7f14322f56c4590d","observation_id":"8847315a-6971-4b00-a272-49be1b9d1b92","resolution":{"observed_at":"2026-08-11T16:36:34.710222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-11T12:46:59.433530Z","title":"Revisiting referring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.433530Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:181b05032eabd071134f74ae89e2311c73e47ef73d6390b04592fce6bcc3346e","observation_id":"0b2efd09-6a65-4065-bb2f-bb74d5075251","resolution":{"observed_at":"2026-08-11T12:46:59.433530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2406.16866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-02T03:06:30.418964Z","title":"Revisiting refer- ring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":"fb0b98eb-d70a-448f-8931-92dcb59d161d","year":2024},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-16T10:23:40.545862Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:28bf146e8e4d106c137a76fb0c1346edba04d272564157eb34778a099e273697","observation_id":"05ff9b75-378d-4771-9df1-bd40edd1ee85","resolution":{"observed_at":"2026-05-16T11:39:22.476383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-16T12:19:36.748237Z","title":"Revisiting referring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-16T12:10:39.788732Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.748237Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:48edc55d1a884e115c96baba940a90cb507475998fad15cd5280fe915fa919d9","observation_id":"750f8264-b226-4935-b8ae-ca15a37c60bd","resolution":{"observed_at":"2026-08-16T12:19:36.748237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-16T11:16:15.679702Z","title":"Revisiting referring expression comprehension evaluation in the era of large multi- modal models.arXiv:2406.16866, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-08-16T11:08:55.215309Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:15.679702Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2504.16072"},"observation_digest":"sha256:f0232869cc152b93f05962df63f16d3289df1446282c67b43bcdab395900d52a","observation_id":"53d18302-1b89-4e28-9c2f-f93f8e69bb9f","resolution":{"observed_at":"2026-08-16T11:16:15.679702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-15T23:50:35.289793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03673","last_updated":"2025-06-05T23:45:32Z","snapshot_observed_at":"2026-08-15T23:43:12.646233Z","submitted_at":"2025-05-06T16:11:49Z","title":"RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T23:50:35.289793Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2505.03673"},"observation_digest":"sha256:a087d492b7ea4726895561a265d9c1820959bf9e2552aac78ce585075b2c53da","observation_id":"15668e53-1611-4e51-8800-4b57851c1a04","resolution":{"observed_at":"2026-08-15T23:50:35.289793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2406.16866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-02T03:06:30.418964Z","title":"Revisiting refer- ring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":"fb0b98eb-d70a-448f-8931-92dcb59d161d","year":2024},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:72a82ea985abd2af109f3c25d9ffcfc0aea06138ed59bdbb5b2a598be3e0a6e5","observation_id":"b62095e3-85b8-401e-96ee-90db625f3260","resolution":{"observed_at":"2026-05-12T10:53:26.615927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-04T09:45:01.649392Z","title":"Revisiting referring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13796","last_updated":"2026-06-03T15:56:23Z","snapshot_observed_at":"2026-08-17T11:54:33.365525Z","submitted_at":"2025-10-15T17:56:15Z","title":"The Mechanistic Emergence of Symbol Grounding in Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T09:45:01.649392Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2510.13796"},"observation_digest":"sha256:fa73e39f197396d76be9d5b27aa3d729c134a72e986254431e5cde0a95e80843","observation_id":"0d56b3be-ae1c-4d34-9335-5e815e5e7573","resolution":{"observed_at":"2026-08-04T09:45:01.649392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2406.16866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-02T03:06:30.418964Z","title":"Revisiting refer- ring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":"fb0b98eb-d70a-448f-8931-92dcb59d161d","year":2024},"citing_paper":{"arxiv_id":"2606.04282","last_updated":"2026-06-02T23:14:46Z","snapshot_observed_at":"2026-07-06T23:44:23.633099Z","submitted_at":"2026-06-02T23:14:46Z","title":"FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:16:53.915716Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2606.04282"},"observation_digest":"sha256:d0546046a839708d43dd9e5051c9af3f887d32b095cefb886abf6cd634910844","observation_id":"7f446895-3ac8-403a-9351-5e3c71dd2064","resolution":{"observed_at":"2026-07-02T03:06:30.421473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-12T11:14:52.015620Z","title":"Cheng, T.; Song, L.; Ge, Y.; Liu, W.; Wang, X.; and Shan, Y.2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28862","last_updated":"2026-07-05T22:18:45Z","snapshot_observed_at":"2026-08-16T11:35:15.627775Z","submitted_at":"2026-06-27T11:10:33Z","title":"HKVLM: Faithful Query--Region Binding for Frozen-Detector Visual Grounding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T11:14:52.015620Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2606.28862"},"observation_digest":"sha256:6bf1f0fa9de03d62204d07de2caf1d9ead8d7c54276b74e49e733ed2fb52d884","observation_id":"a2cf8f59-6714-45bc-8395-4bdbb072b083","resolution":{"observed_at":"2026-07-12T11:14:52.015620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.16866/citation-record","integrity":"/paper/2406.16866/integrity","json":"/paper/2406.16866/citation-record.json","paper":"/paper/2406.16866"},"outbound":[],"paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:40:01.401453Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2406.16866."}