{"as_of":"2026-08-23T23:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16b72697889284f474b3c79719234bee9c3b61f0845c02850cc6ab668afb3fcf","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T13:22:13.267737Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T15:01:03.556212Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T23:18:25.494068Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":"2512.24561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.24561","snapshot_observed_at":"2026-07-01T02:17:18.600387Z","title":"arXiv preprint arXiv:2512.24561 (2025)","venue":null,"work_id":"15aebe2a-8f98-48ac-bf6e-3179dfa95699","year":2025},"citing_paper":{"arxiv_id":"2604.00270","last_updated":"2026-06-05T03:05:20Z","snapshot_observed_at":"2026-08-20T01:56:44.062129Z","submitted_at":"2026-03-31T21:51:36Z","title":"OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T23:17:45.005518Z"},"links":{"cited_paper":"/paper/2512.24561","citing_paper":"/paper/2604.00270"},"observation_digest":"sha256:be169d8d1d9ef55c965220a305400d6a6d509db967dcf1f55a8f15a6ef053852","observation_id":"627a73fa-a568-4ebf-95f0-97a79ed31635","resolution":{"observed_at":"2026-07-01T02:17:18.600387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24561","snapshot_observed_at":"2026-07-13T15:15:25.977993Z","title":"arXiv preprint arXiv:2512.24561 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.00270","last_updated":"2026-06-05T03:05:20Z","snapshot_observed_at":"2026-08-20T01:56:44.062129Z","submitted_at":"2026-03-31T21:51:36Z","title":"OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T15:15:25.977993Z"},"links":{"cited_paper":"/paper/2512.24561","citing_paper":"/paper/2604.00270"},"observation_digest":"sha256:10c4068320c7a6d6c9c66638f27439a35d27b4a065e20bf7496706f05bc4ee2f","observation_id":"88a6f25c-1961-4add-97de-c2a9524ed012","resolution":{"observed_at":"2026-07-13T15:15:25.977993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":"2512.24561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.24561","snapshot_observed_at":"2026-07-01T02:17:18.600387Z","title":"arXiv preprint arXiv:2512.24561 (2025)","venue":null,"work_id":"15aebe2a-8f98-48ac-bf6e-3179dfa95699","year":2025},"citing_paper":{"arxiv_id":"2605.02258","last_updated":"2026-07-29T02:01:36Z","snapshot_observed_at":"2026-08-13T19:48:02.511153Z","submitted_at":"2026-05-04T06:09:13Z","title":"SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-09T16:10:23.516635Z"},"links":{"cited_paper":"/paper/2512.24561","citing_paper":"/paper/2605.02258"},"observation_digest":"sha256:e767f3cac578366380e12542deb836eb03c309ee0995f7e2741d06c85d0465b9","observation_id":"bc4d7ac6-4525-4f87-9402-b4fb9e1bb77a","resolution":{"observed_at":"2026-07-01T02:17:18.600387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24561","snapshot_observed_at":"2026-08-02T15:01:03.556212Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.02258","last_updated":"2026-07-29T02:01:36Z","snapshot_observed_at":"2026-08-13T19:48:02.511153Z","submitted_at":"2026-05-04T06:09:13Z","title":"SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T15:01:03.556212Z"},"links":{"cited_paper":"/paper/2512.24561","citing_paper":"/paper/2605.02258"},"observation_digest":"sha256:2ec5642d78631f1df95132be6e0674917e68b10c1f19a0b638c7c9bc495390b7","observation_id":"5199272c-3e9f-4c74-9573-f11b653460ee","resolution":{"observed_at":"2026-08-02T15:01:03.556212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.24561/citation-record","integrity":"/paper/2512.24561/integrity","json":"/paper/2512.24561/citation-record.json","paper":"/paper/2512.24561"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.475422Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.475422Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:3fb485a7a37a6afa89847aafba199f10ef8ba7c08c03523fd870e7b2c82bd0fb","observation_id":"1407b649-e64b-40d9-8988-2a1232010af3","resolution":{"observed_at":"2026-08-03T13:22:07.475422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.532784Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.532784Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:380cb9b40faee32b94460abbbbc8a66b6a792ef4cd50e18e96289002121933c5","observation_id":"bb100858-17d2-40bd-8059-6adb8e7479c1","resolution":{"observed_at":"2026-08-03T13:22:07.532784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.598268Z","title":"Cops-ref: A new dataset and task on composi- tional referring expression comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.598268Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:f374e9fa17476f7adc8fd8ca87cb0084c4ac3d274a136c958fc70ea8b1c3133f","observation_id":"1ee842d9-9938-44b3-8875-9f63b5e079d2","resolution":{"observed_at":"2026-08-03T13:22:07.598268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.673878Z","title":"Unit3d: A unified transformer for 3d dense captioning and visual grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.673878Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:3988a3ae1d3ae2ea777a650514583c1a927f497d965a9fb63d06403a23268ebe","observation_id":"4f01e7a2-af88-41f5-81fe-71e9cd1c16a8","resolution":{"observed_at":"2026-08-03T13:22:07.673878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.741282Z","title":"Advancing visual grounding with scene knowl- edge: Benchmark and method","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.741282Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:0c8278163bf000f832c1a414801eb0b0302080fc33a5fb809581c0d01e0fd057","observation_id":"7e262af5-d149-42b1-92a0-23ca710517fe","resolution":{"observed_at":"2026-08-03T13:22:07.741282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.814739Z","title":"Transvg: End-to-end visual ground- ing with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.814739Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:d0d73788251a89c028f43161360b44e4a86dace4f8c48d61d1747f601ca95818","observation_id":"c45022d3-1c20-4f82-9414-230b44a1a92e","resolution":{"observed_at":"2026-08-03T13:22:07.814739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.875627Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.875627Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:5baa9361e5a695fbe44a2d3042f05ad57b6c6c61300e76477764b3ba0f65e9c5","observation_id":"309e8538-795e-47ea-a566-b1d1f7993058","resolution":{"observed_at":"2026-08-03T13:22:07.875627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:07.982432Z","title":"D3t: Distinctive dual-domain teacher zigzagging across rgb- thermal gap for domain-adaptive object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:07.982432Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:da2c0a26e0d4bd6f9100beec2b611fce1908cfbce6edaf9a5500ae4d2fc07e22","observation_id":"49a85298-a2b6-4d7a-99f7-a5e211ef41ab","resolution":{"observed_at":"2026-08-03T13:22:07.982432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T13:22:08.081744Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.081744Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:498e6e56e1cf59b449d03953942cf721d30295445f785c891a06a01e3a7c54ff","observation_id":"0af4a103-7809-46c1-9dc7-8b4af125131b","resolution":{"observed_at":"2026-08-03T13:22:08.081744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.183519Z","title":"Large-scale adversarial training for vision- and-language representation learning.NeurIPS, 33:6616– 6628, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.183519Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:39db136fd968d53c74afd6d531d3721958b10940c90466ec65421af30f7d649c","observation_id":"bdd8dfea-ecb2-4268-8898-5ba49f84d6a4","resolution":{"observed_at":"2026-08-03T13:22:08.183519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.253760Z","title":"Room-and-object aware knowledge reasoning for remote embodied referring expression","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.253760Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:fa01aaaaec3989e044aee04de80e184ccec74b8491728dbdcecb2bc3c53a65fa","observation_id":"fec1444d-f117-40fc-b782-b787c38ec76d","resolution":{"observed_at":"2026-08-03T13:22:08.253760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.349314Z","title":"The iapr tc-12 benchmark: A new eval- uation resource for visual information systems","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.349314Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:1454da1adba6b80ac501ea9944265302d099df8ab43c1342242302330d30faab","observation_id":"b0f35396-7226-4bdd-bae3-aeb7dbf0eff2","resolution":{"observed_at":"2026-08-03T13:22:08.349314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.447263Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.447263Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:ef1e2f02510b3abefa49291fbf4f389f76da20be5f5718f6552806b44c48e164","observation_id":"cc6a1b54-228b-4f93-a57e-b5970a8e6004","resolution":{"observed_at":"2026-08-03T13:22:08.447263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.559249Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.559249Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:525c329b04bc5f9b5510a4cc132f6528b92a3234e68d6e65ba2cce0308dfe904","observation_id":"a4bddb92-2038-49c6-b0a5-b5ccd64e6ac0","resolution":{"observed_at":"2026-08-03T13:22:08.559249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.727448Z","title":"Ei 2 det: Edge-guided illumination-aware interactive learning for visible-infrared object detection.TCSVT, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.727448Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:4f1ea3235bcfc342ed61ddfb398fdbbc76fd45c938e18963b6c7b5ace3c42e62","observation_id":"7db8483a-6139-4464-94e5-d1b3dd79514a","resolution":{"observed_at":"2026-08-03T13:22:08.727448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.836138Z","title":"Beyond one-to-one: Re- thinking the referring image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.836138Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c3fc9d3bad9a281aa36c3947faae7e36e5817c97a7dee83bbf82273c65a990a1","observation_id":"d41f7c38-41e1-478f-9bea-ac274ef82114","resolution":{"observed_at":"2026-08-03T13:22:08.836138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.924987Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.924987Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:767d3951ab811f51c8a492b4a7acc3b65d16f29cf29b10747716ae1ee4abd12c","observation_id":"2e61ec8c-4d4e-468c-8cd5-b5de161dd86f","resolution":{"observed_at":"2026-08-03T13:22:08.924987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:08.997393Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:08.997393Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:1a9b00f12ff1477feb9c8e52bddd6bded608efc142bf68dd316b7291c573f768","observation_id":"4f621396-d7f2-4d0c-857b-b445360ee236","resolution":{"observed_at":"2026-08-03T13:22:08.997393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.187025Z","title":"Rgb-t semantic segmentation with location, activation, and sharpening.TCSVT, 33(3):1223–1235, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.187025Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:ca37dd4082ac08098efb18d5ec7bcb0ec69ead210c39d1c13cb06010f34f075b","observation_id":"567a5f88-d237-42e1-a838-7af3bed1a193","resolution":{"observed_at":"2026-08-03T13:22:09.187025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.301713Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.301713Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:f2289a471f4a7f60de21655f5a8fbb0f9f00312c964706512a2e2d6a8f864393","observation_id":"da724d24-8ca5-4d5b-af96-fad6aa94cef9","resolution":{"observed_at":"2026-08-03T13:22:09.301713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.356679Z","title":"Gres: Gen- eralized referring expression segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.356679Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:3da3c8ef798ca40b66ae7cbeced078fbc0aca096a6c87af3e68bfd348e7b31dd","observation_id":"0f038089-9ff8-44a7-93b0-98721e65a4cd","resolution":{"observed_at":"2026-08-03T13:22:09.356679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.469324Z","title":"Refer-it-in-rgbd: A bottom-up ap- proach for 3d visual grounding in rgbd images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.469324Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:08125de843c1149d2ca3feea731068597fe4294332bfe8fd2911308bbab0e15e","observation_id":"91129e57-d05f-4298-9e37-598bc2d60a90","resolution":{"observed_at":"2026-08-03T13:22:09.469324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.627654Z","title":"Visual instruction tuning.NeurIPS, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.627654Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:fabf40eb8a4df69f24837b3c82999fb5974c1c046c46bbe26798b2fec8ca14cf","observation_id":"805d9a1c-b4cc-4c9d-a0bb-5c60bdf049ce","resolution":{"observed_at":"2026-08-03T13:22:09.627654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.685054Z","title":"Target-aware dual adversarial learning and a multi-scenario multi-modality benchmark to fuse infrared and visible for object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.685054Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:41d31d948f178f207631e15d6f9c9faa583009ec99a4be8b7a392cbc8e35f246","observation_id":"ef9c6c3c-4cfd-49bc-acf8-1c69cd8fed7d","resolution":{"observed_at":"2026-08-03T13:22:09.685054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.797495Z","title":"Cross3dvg: Cross-dataset 3d visual grounding on different rgb-d scans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.797495Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:b708f62aa92ef216156513cb009df90ef1b56760ce17a13931001f47b4c283ae","observation_id":"2edb6309-ac5c-4d98-8c91-1603d2351ad4","resolution":{"observed_at":"2026-08-03T13:22:09.797495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:09.957036Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:09.957036Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:1006f8f157afa95a3f37faee5f900382de7bbcc7a3696f92bbf6be70580bc4d9","observation_id":"959bbfc9-1512-42d2-9499-e1385b44ed0f","resolution":{"observed_at":"2026-08-03T13:22:09.957036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.034272Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.034272Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:614d69f0fe78995622fa6a06753d77cf01035e882a1c947a3570f908ba0c7d36","observation_id":"a25a0121-4167-462c-b42c-b046a3549897","resolution":{"observed_at":"2026-08-03T13:22:10.034272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.056944Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.056944Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:25e6009b006ab6ecc8ce2dd06796b00b5b6afc39e4712a2eb5ba208cc994ebe1","observation_id":"031b6ad1-fc67-4964-bacc-bea7a1ee9cf7","resolution":{"observed_at":"2026-08-03T13:22:10.056944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.132196Z","title":"Dynamic mdetr: A dynamic multimodal transformer decoder for visual grounding.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(2):1181–1198, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.132196Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:f4b8462f4163c0a2382cd2ada3ca7d94a282e5c9e16eea5efee2d417c6143068","observation_id":"eb5116eb-af16-4e42-937b-d9932eec4ee4","resolution":{"observed_at":"2026-08-03T13:22:10.132196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.165003Z","title":"Attention is all you need.NeurIPS, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.165003Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:0dcf42e0621c894acecbff53a5c612ac650f7911ec599e7ab1de67761d9f6bee","observation_id":"869f0c3c-cdca-453f-9644-63d37f1169f5","resolution":{"observed_at":"2026-08-03T13:22:10.165003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.222723Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.222723Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:7f5a6a3ae20333048e506bf61f15b71dedb28f01e3e1eeb1b2fcc85fe0522519","observation_id":"e8659ac2-f1dd-4ebf-a7c2-4e7b6a7a8794","resolution":{"observed_at":"2026-08-03T13:22:10.222723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.291114Z","title":"Image as a foreign language: Beit pretraining for vision and vision- language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.291114Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:08a8fc36e7307c2f94fcba25191c34ffdbbb52a56279e0798d17c9eb7819f6a3","observation_id":"aa35b809-d83d-43ca-a718-0ed735563433","resolution":{"observed_at":"2026-08-03T13:22:10.291114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.359561Z","title":"Clip-vg: Self-paced curriculum adapting of clip for visual grounding.TMM, 26:4334–4347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.359561Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:639b231bf23638acd1e45f8e7c8a576fcef8affc66b444435edc648af3cd1267","observation_id":"a43b6454-1678-48d8-b9d4-e4e4a696c5cb","resolution":{"observed_at":"2026-08-03T13:22:10.359561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.534984Z","title":"Towards visual grounding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.534984Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:898f5d85a3baf257aa64d20e53e4c422bed0ec7d570c8288868216dfe5022de6","observation_id":"ceb9017f-6716-48c9-bdeb-10dcb348b875","resolution":{"observed_at":"2026-08-03T13:22:10.534984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.608296Z","title":"Hivg: Hierarchical multimodal fine- grained modulation for visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.608296Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:1a2f9545999d5dabd826666e9fd1f1bd92e112a7c56483974e19b85433bb3539","observation_id":"9cbcbc35-a951-4641-b7ab-2c7b948aa364","resolution":{"observed_at":"2026-08-03T13:22:10.608296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.690297Z","title":"Oneref: Unified one-tower expression grounding and segmentation with mask referring modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.690297Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:deee5aee6230fa243557d19f75507efb725a15dfc7c4704b22a276009e856969","observation_id":"1a5d5a3c-e6fa-4de4-81e3-4fa0ff4433bf","resolution":{"observed_at":"2026-08-03T13:22:10.690297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.751759Z","title":"Described object detection: Liberating ob- ject detection with flexible expressions.NeurIPS, 36:79095– 79107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.751759Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:cd15f83f33b1fa37c10803e9e0545fcf43e2b376a7afe47e0174d4a6102915e1","observation_id":"894c0ae2-e442-40e5-bf4b-3d0ed8e4c595","resolution":{"observed_at":"2026-08-03T13:22:10.751759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.859018Z","title":"Mc-bench: A bench- mark for multi-context visual grounding in the era of mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.859018Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:3480cd9d012358f4f9ab45837e3603b94185e8977f583544f4717c83ddef9c20","observation_id":"12bd4718-e362-4862-b9b4-8c237dc051b9","resolution":{"observed_at":"2026-08-03T13:22:10.859018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.963077Z","title":"Improving one-stage visual grounding by recursive sub-query construction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.963077Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:86d620ae04d6c4d3a76a7e90f19f43c241ce4bff6e38bed7d84bc1471d11b267","observation_id":"a5317b8b-90d2-4892-949b-1340eea2232c","resolution":{"observed_at":"2026-08-03T13:22:10.963077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.074241Z","title":"Unitab: Unifying text and box outputs for grounded vision- language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.074241Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:143e5a27a9fd2540a40117ea3bfdf741240ac70cf6d5c535bad597a3883193a1","observation_id":"0e63b9eb-7172-4b40-80d8-6b4f06347bfc","resolution":{"observed_at":"2026-08-03T13:22:11.074241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.136609Z","title":"Vi- sual grounding with multi-modal conditional adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.136609Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:66e2a83717bd1ae66c4ef6b0f7313c537b3b7fe2092a686629a3b3b669ab9bdd","observation_id":"1cb76a83-6046-4b61-a18b-eb439b5d1d27","resolution":{"observed_at":"2026-08-03T13:22:11.136609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.208551Z","title":"Shifting more attention to visual backbone: Query-modulated refinement networks for end-to-end visual grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.208551Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6826c3b91396de837f2e15c0999d1aa580831bde68a7d3dcd42632fda9d0b29d","observation_id":"2c7be307-2a62-4605-a87a-d3324ed593d0","resolution":{"observed_at":"2026-08-03T13:22:11.208551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.270069Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.270069Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:fe19fd7eba0547734c96a2716b5710c3071f63220ff1130c698f74883005f9cc","observation_id":"183bb79e-93ef-4873-9853-bf4a36d29ada","resolution":{"observed_at":"2026-08-03T13:22:11.270069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.310614Z","title":"C 2former: Calibrated and complementary transformer for rgb-infrared object de- tection.TGRS, 62:1–12, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.310614Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:0ca53b39bffc558889dbe5bc1dd60f9fecfd6d59f1503d583562e6ad8d36e439","observation_id":"ac0055fa-fcb5-4ab3-915c-2aedee084a49","resolution":{"observed_at":"2026-08-03T13:22:11.310614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.392019Z","title":"Trans- lation, scale and rotation: Cross-modal alignment meets rgb-infrared vehicle detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.392019Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:45052cd3e38f2e8f4d34e69df5fd53650eedbd92a6f9a7b6fcf74e22f767a4b4","observation_id":"f90310fa-9edf-45f6-8e1c-d43a87e061ba","resolution":{"observed_at":"2026-08-03T13:22:11.392019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.462234Z","title":"Improving rgb-infrared object detection with cascade alignment-guided transformer.Information Fusion, 105:102246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.462234Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:427bf5c7fed95a8e894acd0f5220a92fd68f67c379b9127f3034f7237d19b26a","observation_id":"019f9ec1-96dc-4537-91fa-742ced008088","resolution":{"observed_at":"2026-08-03T13:22:11.462234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.542644Z","title":"Unirgb-ir: A unified frame- work for visible-infrared semantic tasks via adapter tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.542644Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:fc90179ab5cba7fb68161af74cb2072e151fd1a9df9828783e211f71f041b6b0","observation_id":"7933f4bf-8206-414e-9d2f-76a2fef01119","resolution":{"observed_at":"2026-08-03T13:22:11.542644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.610798Z","title":"Multispectral fusion for object detection with cyclic fuse-and-refine blocks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.610798Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:79f2752824ece491a745e976a4d2b8abf92f4013bac10b7be9c17bb9dc3db82f","observation_id":"5dc45d55-c7c5-452b-95b5-0ee8441e4abf","resolution":{"observed_at":"2026-08-03T13:22:11.610798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.644623Z","title":"Abmdrnet: Adaptive-weighted bi-directional modality difference reduc- tion network for rgb-t semantic segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.644623Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:86dc11f3b8b175c450ee23bcb261166057e1c0590bda6471bf8d20249c703045","observation_id":"ee7be17c-9ea4-40a8-88c4-0ed0c8c9468e","resolution":{"observed_at":"2026-08-03T13:22:11.644623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.726883Z","title":"Removal then selection: A coarse-to-fine fusion perspective for rgb-infrared object detection.arXiv e-prints, pages arXiv–2401, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.726883Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:ace78eb512faff68def481069bb0cdbea1ea6d9727bc914eb7e6d8c8e9fcdfbf","observation_id":"81ffd4b3-5722-4dc6-a3e6-57e85c43e6d4","resolution":{"observed_at":"2026-08-03T13:22:11.726883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.831105Z","title":"be- hind the truck","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.831105Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:38739fee853805e0eb1605c0ca88d8fb73a4dd52316856ac4aa40eb5ff968285","observation_id":"e354113d-a2f4-4527-8820-a55cb53aab71","resolution":{"observed_at":"2026-08-03T13:22:11.831105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:11.914135Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:11.914135Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:9bbb5694133b353e77cd20872d84d3a3cf4efb1f05ddbc159bc1af851f6b9375","observation_id":"c1623795-31fe-4d43-b53b-225543485a47","resolution":{"observed_at":"2026-08-03T13:22:11.914135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.001270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.001270Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:ba3fd44a6ad81c52e8905395c31c8f753a0292416a2a285ab21d9ca74db67e08","observation_id":"edfd31a8-d30e-41d2-b6fc-ff48332fbe89","resolution":{"observed_at":"2026-08-03T13:22:12.001270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.187388Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.187388Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:837a25d0bacfad0afddb8c8dfe2babfe529c2195e22ade79121898fd912a9d89","observation_id":"c2fb9113-c4ab-4fc6-b8f0-796a559df62c","resolution":{"observed_at":"2026-08-03T13:22:12.187388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.218174Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.218174Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:9cb251a0a31449b52a131db207203e2d23afdb9adc8091348935be9608128d05","observation_id":"f96a5e63-4701-43df-b6b6-4fd64bd69e3e","resolution":{"observed_at":"2026-08-03T13:22:12.218174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.304908Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.304908Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:a352335605c00b42333de988067978207a5ee1d198ac54849e93008598606362","observation_id":"f32a7b6f-b590-4184-867f-954a7f47a86c","resolution":{"observed_at":"2026-08-03T13:22:12.304908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.488625Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.488625Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:d46f3cb342400e28aa2b5137b76f6d9ac60c36349b5ca0a77b3234462350ecf7","observation_id":"0a7c6681-4264-499d-bf3a-75c1b9f15d4d","resolution":{"observed_at":"2026-08-03T13:22:12.488625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.615969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.615969Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6af374d33e65f25d65d67bb15ab74e2d2ff8648c001dcb8dc4e9ed61ad019ac9","observation_id":"38d3df62-5325-4b4b-a79a-586a1f9b87c8","resolution":{"observed_at":"2026-08-03T13:22:12.615969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.686063Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.686063Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:d5898d715a836ade0a00bd0575448aa3a65c4c8b07bf8fd323ebfa94e5491a36","observation_id":"8540625b-e574-43fd-ac62-002f82383d36","resolution":{"observed_at":"2026-08-03T13:22:12.686063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.756090Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.756090Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:c9fd2c7a4760aa79bafe069b928ff5e6520c7dfdb75a8a390074dac6b14a164c","observation_id":"400a225d-e54d-46b3-838d-7cec33fbae08","resolution":{"observed_at":"2026-08-03T13:22:12.756090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.820399Z","title":"near the stairs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.820399Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:cc42975c26931313ecec82c9b38a41fd726b2820c1a1ef13ddc00bbf08f60f58","observation_id":"7beeb4e8-13a5-4879-bb26-19bbae99ffcc","resolution":{"observed_at":"2026-08-03T13:22:12.820399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.879990Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.879990Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:723a7fbf8214f4dfd250bf2a1c119d7a27df4f6133022f6281fe08d6e02b55ed","observation_id":"386a503d-75d2-4be4-93ec-f822478cd406","resolution":{"observed_at":"2026-08-03T13:22:12.879990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.957929Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.957929Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:6653cd1367dbfb094e69028091dee221e6b26d1d1411067af1dec106d3f36742","observation_id":"4919d6e8-abb9-4622-94ab-c7e6a8db808f","resolution":{"observed_at":"2026-08-03T13:22:12.957929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:12.979078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:12.979078Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:17a817a1f2918d475ddfb4029caf273cc8ab3aedf743e472c4aa89067269c289","observation_id":"bf3a12b4-79e7-4ca7-9f1a-43aa71c047d2","resolution":{"observed_at":"2026-08-03T13:22:12.979078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.007925Z","title":"Please return only one number corresponding to the lighting condition: 0 (very_weak_light), 1 (weak_light), 2 (normal_light), or 3 ( strong_light)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.007925Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:07bbb4c4b240bafa570078b26d74947905383388881ae3ee50b79765cafa4ca1","observation_id":"9c91cae0-6661-4ba5-a87e-7c2c9c824b6b","resolution":{"observed_at":"2026-08-03T13:22:13.007925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.051235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.051235Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:995c7750eef4fdfaf66eaab6f4335009260e3361d5cd69d943efb139ade2806a","observation_id":"f67d87e2-450c-474c-ae53-981ab63e3435","resolution":{"observed_at":"2026-08-03T13:22:13.051235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.131462Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.131462Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:f7572c2f8e6a6d5aa683d8f56b4e70a011d7f0269589fd03e0a2a397948a38d6","observation_id":"6b6846cd-bf47-4eb4-8db7-40c503b7c1e3","resolution":{"observed_at":"2026-08-03T13:22:13.131462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.221032Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.221032Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:10291fc41151cd425e95f11281ce8f0151b3c4c80ecd418fcb3eb94bb98f5867","observation_id":"540c878a-3b0f-4679-b930-fbd5c2801678","resolution":{"observed_at":"2026-08-03T13:22:13.221032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:13.267737Z","title":"small\"ifsize_ratio < 0.01else","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:13.267737Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:3b5fe3e23beafd4fbd1405a291e721f0c991efeabe01230fb405ff9b1c102370","observation_id":"806563eb-1840-4fbb-8b28-9cef8c06c8b0","resolution":{"observed_at":"2026-08-03T13:22:13.267737Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:22:10.429051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T13:22:10.429051Z"},"links":{"citing_paper":"/paper/2512.24561"},"observation_digest":"sha256:d00793b4d17783806f4991951e75c33cda87e15ebeaa3008e558e9d1cb87c099","observation_id":"ef0166ab-e496-4d55-88d5-ec756ac1c30e","resolution":{"observed_at":"2026-08-03T13:22:10.429051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.24561","last_updated":"2026-06-30T08:16:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T10:29:23.974256Z","submitted_at":"2025-12-31T02:01:02Z","title":"RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 4 inbound Pith citation observations for arXiv:2512.24561."}