{"as_of":"2026-08-18T09:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df13bc23f4a73e5bf4957885cadbaf198c1992779e49199f8099ca7259ac16ce","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:12:14.964857Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16974/citation-record","integrity":"/paper/2508.16974/integrity","json":"/paper/2508.16974/citation-record.json","paper":"/paper/2508.16974"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:14.825139Z","title":"A survey on large language model (LLM) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.825139Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:2725d9b1d231d8490eb4b97285e6dd00b6e5043ce0f424fc1d9435e2663d546e","observation_id":"be8cb9f3-ad98-430a-bf66-d46eb02392a8","resolution":{"observed_at":"2026-08-15T17:12:14.825139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:14.830658Z","title":"Visual in-context learning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.830658Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:82d3cffab70b171bde113bb1f6a13d62bb311f952d6481d6152c3ed4b54d8fd5","observation_id":"a51ea89a-8c4f-441e-908b-1b5e83f29dc3","resolution":{"observed_at":"2026-08-15T17:12:14.830658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:14.835705Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.835705Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:e6b694704678ffce070fb39059bfa9650f3eee1be1b3e86dfa2f96c8f37b93e6","observation_id":"b619d075-625c-4cb0-8642-dc664a2714c8","resolution":{"observed_at":"2026-08-15T17:12:14.835705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:14.840811Z","title":"Multimodal event transformer for image-guided story ending generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.840811Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:c58a878fdbce1274b91ab692fc6865eb45bb450901ca346f4b88444f33d5e593","observation_id":"46db9d66-cade-4a98-8e46-00e1158efbf6","resolution":{"observed_at":"2026-08-15T17:12:14.840811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.425737Z","title":"A comprehensive survey of knowledge-based vision question answering systems: The lifecycle of knowledge in visual reasoning task,","venue":null,"work_id":"26476444-3790-40f4-8cf6-9ca4a18260fe","year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.846001Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:d2c2d8a6af84e432d7a074f91bb810544b5a243f684286e8e0bd75ddca5ef386","observation_id":"c1c2bb6f-087c-4301-beaf-cf420bbf57f9","resolution":{"observed_at":"2026-08-15T17:12:15.431514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.405326Z","title":"Culture and hallucinations: overview and future directions,","venue":null,"work_id":"28cba55c-cd18-4c01-8c12-c6b5b536ca23","year":2014},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.851229Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:90fc5aaa56e47f7adf488c2f397877230180aa7d77bbe02996d87ed8aeb35895","observation_id":"14f131fd-694d-44db-a0b1-e00ca27cfbfa","resolution":{"observed_at":"2026-08-15T17:12:15.412837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-16T16:25:00.729157Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-15T17:12:14.856735Z","title":"Improving medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.856735Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:81848e2b45872d11f3232743e27859e760dfd355db46be9be17bfa2edb9bfaa1","observation_id":"44b49b13-3a2b-426c-ac1f-ad57371ada57","resolution":{"observed_at":"2026-08-15T17:12:14.856735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-16T14:43:11.499242Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-15T17:12:14.862091Z","title":"Thread of thought unraveling chaotic contexts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.862091Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:2a716c368c17bea8d66eefa5e8ee44e4cb89552e38e60f0d3677c054989b9376","observation_id":"aa513c0e-d795-4ef4-91ad-5bdc1bbde082","resolution":{"observed_at":"2026-08-15T17:12:14.862091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.385626Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"4b319a07-2fc6-4511-8c30-24c4c563b404","year":2022},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.867271Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:b574c6d25f7621eac6bbb43db89f6d72da80311c5c1b742b2821dd5d43683c5b","observation_id":"01715967-96e1-405d-a024-b5f9419b7606","resolution":{"observed_at":"2026-08-15T17:12:15.391633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.367472Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"607b5418-4351-4003-9909-a94de1767ec1","year":2023},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.872031Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:475f9a96b7f3581b2fbc33cf6d3633e96cff6cfa4c5b8bc864e0c22d4ccf3b77","observation_id":"01ed2a53-977a-4bf1-a1de-374ea9fe16c9","resolution":{"observed_at":"2026-08-15T17:12:15.372661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:14.877008Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.877008Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:a5284c6ca93fcec38bbc67a3c3e54f2c1cf7e0120cb8b0a02ba8e597bccf920a","observation_id":"497e9d34-de45-45ac-b634-cf2d438f6bbc","resolution":{"observed_at":"2026-08-15T17:12:14.877008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.339053Z","title":"GQA: A new dataset for real- world visual reasoning and compositional question answering,","venue":null,"work_id":"e702bd7d-257c-49ab-851b-4990c41a7d07","year":2019},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.881816Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:f946eee475c04f8c895681944cb16d36d923c1870d707ca7a9e97817b57efe25","observation_id":"fcb32ac4-8ab4-4e15-855c-ecf7a542b055","resolution":{"observed_at":"2026-08-15T17:12:15.344129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.322138Z","title":"A-OKVQA: A benchmark for visual question answering using world knowledge,","venue":null,"work_id":"dd97db07-98c6-4064-a1f9-51cb4a4acb83","year":2022},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.886566Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:ea5444bf7bac2d2144ae4003d0b37ff592037ba42957f9b27be430859b6e9159","observation_id":"8a1de3c9-cb99-4917-b2a7-786b127b7691","resolution":{"observed_at":"2026-08-15T17:12:15.327589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.303401Z","title":"Revisiting referring expression comprehension evaluation in the era of large multimodal models,","venue":null,"work_id":"32ace71f-4d14-4cd1-88ff-23985e73b61c","year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.891472Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:c1893344921c7c25084262ae751db3220333669b4ee621d06c8b0cb2c9564914","observation_id":"cfbb57bd-f5e4-4c7a-835a-4f0932060aed","resolution":{"observed_at":"2026-08-15T17:12:15.309390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.285169Z","title":"Debiasing vision-language models for vision tasks: a survey,","venue":null,"work_id":"0353380d-b177-4b3d-97ab-6444808d5f22","year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.896309Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:1ccf26befd1aec9074cfbb39e46981fb84aa01eddcb96ea3cbf880aade678d5a","observation_id":"6e0d7af7-b9de-41ac-abd6-06c3883f30b0","resolution":{"observed_at":"2026-08-15T17:12:15.290672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.267783Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":"e572f844-0e1a-4950-a0ec-2bb6b62eeb9f","year":2023},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.901298Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:abe095cabeb57eea50d58c229bcd76977f15db2a655452f5c33ef2f07dfc3f4d","observation_id":"b49ffc55-3292-4b8b-a6be-24e1bb4de6a4","resolution":{"observed_at":"2026-08-15T17:12:15.273132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.249803Z","title":"Towards multimodal in-context learning for vision and language models,","venue":null,"work_id":"dc48134c-0c0d-4bda-b587-29332eeef5b6","year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.906201Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:3cbdd404b8085e57e7850c518423146ac919404a68c955ab0eb43e0dbef44861","observation_id":"a32ebee4-87de-4849-8d37-88a7dc31ef0e","resolution":{"observed_at":"2026-08-15T17:12:15.255867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.229770Z","title":"VILA: on pre-training for visual language models,","venue":null,"work_id":"b3adc372-09d3-456a-aa04-ea8cc5441cda","year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.911242Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:c3e9a795122c3ab1513077e6dfc5427be56069fe8d1a9164557a26045fef4180","observation_id":"a79a8265-01f7-4aee-9753-a14e1fb32ded","resolution":{"observed_at":"2026-08-15T17:12:15.236460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19835","last_updated":"2025-06-24T17:52:43Z","snapshot_observed_at":"2026-08-16T19:02:48.461504Z","submitted_at":"2025-06-24T17:52:43Z","title":"MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19835","snapshot_observed_at":"2026-08-15T17:12:14.916090Z","title":"Mam: Modular multi-agent framework for multi-modal medical diagnosis via role-specialized collaboration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.916090Z"},"links":{"cited_paper":"/paper/2506.19835","citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:b0a63d1801d84b5e3b840a7e147119782a2f7ca41ac17d746a6b4f58ff10e6cf","observation_id":"6b522645-74d5-4dcf-8a35-e2b4dfdee998","resolution":{"observed_at":"2026-08-15T17:12:14.916090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.210738Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate,","venue":null,"work_id":"7ae87344-52d2-4a0a-9377-18574262f989","year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.921122Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:467e7e1f69b8dd737d760a4192687e040323a4723a5ef1f5a4b22148f07c7b75","observation_id":"3eb9e849-3925-4efc-9e9c-d4903767f67e","resolution":{"observed_at":"2026-08-15T17:12:15.216343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.193625Z","title":"Quantized prompt for efficient generalization of vision-language models,","venue":null,"work_id":"c55a5a54-7632-472f-861f-14c1671a9dfd","year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.925861Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:4a541b048f4336ac43460cb9bbbeb5425d4a8709ff259b9b13a31f248427005e","observation_id":"c9b93399-892d-4236-8494-030d768cd419","resolution":{"observed_at":"2026-08-15T17:12:15.199357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.177105Z","title":"A closer look at the few-shot adaptation of large vision-language models,","venue":null,"work_id":"244ff32d-1026-4f9f-985e-431fd2beabea","year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.931026Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:b4bd9b334822a1d042c7ebabf83ecc1ca59c19d12f6431dbad2cbbb7771616db","observation_id":"9dea9465-5870-4740-82a8-d4f9f4ac9a99","resolution":{"observed_at":"2026-08-15T17:12:15.182253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.160339Z","title":"Analyzing fine-grained alignment and enhancing vision understanding in multimodal language models,","venue":null,"work_id":"5433c315-9cb9-4e19-a236-565659c179eb","year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.935957Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:18be65e985eacfb5e2f9138dfc0579ed030e15fb744299e46fecb445beec3457","observation_id":"602b964a-3c95-48ed-a345-2fe974be4eb6","resolution":{"observed_at":"2026-08-15T17:12:15.165507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.142604Z","title":"Hivg: Hierarchical multimodal fine-grained modulation for visual grounding,","venue":null,"work_id":"c03371c6-4cf5-49b5-a852-fee3fb9542f2","year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.940962Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:1a0877c7ea2e343ccd15ec3ad80bcb9af9de45896b54742eaaf203c7d05ef5bb","observation_id":"197454cb-838f-42f4-b2c4-f781031b7724","resolution":{"observed_at":"2026-08-15T17:12:15.148166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:14.945803Z","title":"Towards grounded visual spatial reasoning in multi-modal vision language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.945803Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:0caac5c2fda2fe2c41d760fbc2de9bbec695901410b1b5f0c7124d2f3d9d8abb","observation_id":"11e6eae3-c70b-4387-9a59-b2b84f91eb5c","resolution":{"observed_at":"2026-08-15T17:12:14.945803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.113138Z","title":"Analyzing and boosting the power of fine-grained visual recognition for multi-modal large language models,","venue":null,"work_id":"0e2680d5-9df8-4d09-bea1-7b51e1ad07f9","year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.950408Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:23d0ce407592ac322f1809741ccf34d04004e9a04e21125a9eae13375b21e848","observation_id":"8e1c078d-fdab-44de-a51a-c01d2ce734c0","resolution":{"observed_at":"2026-08-15T17:12:15.118424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.094918Z","title":"Insectmamba: State space model with adaptive composite features for insect recognition,","venue":null,"work_id":"f7135876-4493-49f1-98a9-94b1c8fa4464","year":2025},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.955278Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:9af6c6ee8488b9a8b2e11e00cb2965c34dbe03db29f3ae214ff5ed9cd5c2365f","observation_id":"23b79258-c320-4949-80b8-c5131073abe0","resolution":{"observed_at":"2026-08-15T17:12:15.100576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.076831Z","title":"Towards visual grounding: A survey,","venue":null,"work_id":"febe47c2-c20f-46d1-83fa-9b91f28f7463","year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.960186Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:4b3a7a7ac7c0738eb030772fc5fbe8368e864c473e14f3090d626a0d0b955162","observation_id":"0d18babe-25b9-47a8-bde5-e1a4d08a29ad","resolution":{"observed_at":"2026-08-15T17:12:15.082407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:12:15.056623Z","title":"Hallucination of multimodal large language models: A survey,","venue":null,"work_id":"3116aa01-40ea-49df-a85b-f5657847fd98","year":2024},"citing_paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:12:14.964857Z"},"links":{"citing_paper":"/paper/2508.16974"},"observation_digest":"sha256:2b02f80a1269f8d3ad44299f33c05f49caa0baf0468e9aa0eca6c75d2f660adf","observation_id":"4b99eb64-a073-44d3-835b-c14bb9e2902f","resolution":{"observed_at":"2026-08-15T17:12:15.064307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.16974","last_updated":"2025-08-23T09:57:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:35:10.037976Z","submitted_at":"2025-08-23T09:57:52Z","title":"Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2508.16974."}