{"as_of":"2026-08-05T18:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70650025942abf001fe979450db8039e5a0aeadca1a09b1abe97545db393078f","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T13:07:55.655699Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:38:51.488742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.13633","snapshot_observed_at":"2026-08-01T23:38:51.488742Z","title":"arXiv preprint arXiv:2601.13633 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15374","last_updated":"2026-07-16T18:18:31Z","snapshot_observed_at":"2026-08-03T21:00:43.071180Z","submitted_at":"2026-07-16T18:18:31Z","title":"Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T23:38:51.488742Z"},"links":{"cited_paper":"/paper/2601.13633","citing_paper":"/paper/2607.15374"},"observation_digest":"sha256:282118e1672abe54358d254bf2c3cab271ca4aac5e9bccc1aece1fb9b8067800","observation_id":"69f25467-88b4-4b13-bac1-282fa739d11b","resolution":{"observed_at":"2026-08-01T23:38:51.488742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.13633/citation-record","integrity":"/paper/2601.13633/integrity","json":"/paper/2601.13633/citation-record.json","paper":"/paper/2601.13633"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:d76961abbaeda2e79946562f2999ea11160f2c1ee119822e053dead1279a8c9c","observation_id":"a6173652-6af4-4e58-9664-5d89c0a99f58","resolution":{"observed_at":"2026-05-16T13:10:56.734420Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"149c46e5-7e01-4598-b358-a1c475aea61b","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:07951849e67fbdc0e231d147d8f218581cf3111ab953d080028f873a33235fb1","observation_id":"17d41e28-cfab-479a-b096-2881c783bb00","resolution":{"observed_at":"2026-05-16T13:10:57.606712Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"13450d71-0993-4723-8dad-b53f7640251c","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:907a4b335d25ac45813abb5606bb70ff800db603bc16d380a992bbfac1d11074","observation_id":"e3fee928-080c-4cc0-a3fa-6803df9e2f3c","resolution":{"observed_at":"2026-05-16T13:10:57.571737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:ea7735990849c65f3dc8379222969aac1758bfbe074110b72bbcdf22441c7424","observation_id":"5202c00d-aabc-4b9c-8091-f04881ccb8cc","resolution":{"observed_at":"2026-05-16T13:10:56.749395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"401b4430-13c0-49b4-b0c1-e2e64d5e5aaa","year":2011},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:9d79dbb2504f36a70cfbd5d612f50774e565b69444ab8119ebb73b26d3be1f22","observation_id":"bdb57217-bae4-4d4d-a551-d3b7f0b7a0f6","resolution":{"observed_at":"2026-05-16T13:10:57.601763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"75f57006-0a62-4b62-aaac-6ff22b80e5c7","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:8e265a2951a5c07ecfddbaa6d5417a464e5b214ada0555e07e5b8fc8454b846f","observation_id":"9374484c-766c-47a3-8528-315e8d0bfa21","resolution":{"observed_at":"2026-05-16T13:10:57.583624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T20:02:56.079865Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"2d7b400b-4ad5-49cc-8638-2338105f26ce","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:cfac85f4eb62c691ade4a3c4609ab3fd8268d7941e182fd0865be4765820f204","observation_id":"f557b503-347e-4997-8c4d-7c825f3316bf","resolution":{"observed_at":"2026-05-16T13:10:57.588840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:2c24e7b20899a1dad9c1491a8276dba99ac251471f75d175a6cc8c120c04adb9","observation_id":"73c063f4-5930-464d-98eb-6750b130d49f","resolution":{"observed_at":"2026-05-16T13:10:56.731528Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv e-prints pp","venue":null,"work_id":"0b34a146-4cec-491c-a0fa-7549b0d2a4e2","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:98d608f987294d00efaf748916a594fd24747a4e0b6254b9b766becd4245a246","observation_id":"9145da1d-2f48-4990-93b3-964499d31458","resolution":{"observed_at":"2026-05-16T13:10:57.616917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv e-prints pp","venue":null,"work_id":"31b60115-5db1-48e2-b461-0fff9d47aed9","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:a570aceb61d7561eeb6caae17a53fef1073ddaed9c3b227a3c46816ec4bf06e0","observation_id":"e871a1c0-4d5f-4179-afeb-a96f3ce206c4","resolution":{"observed_at":"2026-05-16T13:10:57.596770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Ad- vances in Neural Information Processing Systems (NeurIPS) (2024)","venue":null,"work_id":"91cf253c-6e46-4d3c-a969-54b2832b5b10","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:8d7950fc2e59195a929f96c9b2911458f57de348122179d4b3c933f1f150b786","observation_id":"2033dc5d-a4ba-41ff-8e0d-01fa538263d6","resolution":{"observed_at":"2026-05-16T13:10:57.568872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c1083f513462ca0e5f334088b24dc0e3afa708739580b91a9e607c3e21e9d753","observation_id":"ce7bc1b4-cd7e-4b0f-9a93-7db533d80b9a","resolution":{"observed_at":"2026-05-16T13:10:56.719054Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12433","last_updated":"2024-04-02T18:09:22Z","snapshot_observed_at":"2026-08-05T15:42:53.845856Z","submitted_at":"2023-12-19T18:58:40Z","title":"TAO-Amodal: A Benchmark for Tracking Any Object Amodally","version":3},"cited_work":{"arxiv_id":"2312.12433","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12433","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2312.12433 (2023)","venue":null,"work_id":"58bbbe8a-8588-47c9-9c5c-ec65dfe977c4","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2312.12433","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:4bd7ec559912c8ea4c768beeed710b17d83ce7d97b9509836cb994e04f127b35","observation_id":"ab5e14a9-a4d5-4f02-aad9-42cfe5919bcf","resolution":{"observed_at":"2026-05-16T13:10:56.714909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:16cadb593b115b1d91dc75c503676b7c2ec2e5205196ec82c5cd851dfd91760e","observation_id":"ea035e0a-1f92-4a7d-98e4-9ff029116b21","resolution":{"observed_at":"2026-05-16T13:10:56.725695Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Psychological Research88(2), 307–337 (2024) EGM 17","venue":null,"work_id":"a9192712-149b-4ed0-aad9-b94ea00413e6","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:259093d1f5d351c4715107320561ebbd797c445ef4cfb0815c5408effcb4ba37","observation_id":"3aba5604-d2d8-4a51-a8a3-0161ebcdfe5e","resolution":{"observed_at":"2026-05-16T13:10:57.614041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 2014 conference onempiricalmethodsinnaturallanguageprocessing(EMNLP).pp.787–798(2014)","venue":null,"work_id":"a862aed8-37d8-4d50-82f5-e47390a5317c","year":2014},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:d38f3935923f9e7194762019d0a90fad8391f4b9d33d8e54b0103a76cb42be9a","observation_id":"4b004b11-4843-495d-bac8-1d1f29523eea","resolution":{"observed_at":"2026-05-16T13:10:57.604327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"208428de-30ce-4548-a4ca-2aa11981856e","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:da571617ec1dab6b55acef5c013b9c2839723a158a30d22e1d87883d21cffeb0","observation_id":"27bf4157-3794-4325-9f68-d34c245c1a6a","resolution":{"observed_at":"2026-05-16T13:10:57.610286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles (2023)","venue":null,"work_id":"00425924-e417-411f-94b6-b23f98e447e0","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:dbf2d1a255f3a49417aca99b754ba505725c66e950d3d5d5cae0e67b1ea43842","observation_id":"06dab8fa-903d-4831-8a6d-40dd5ef4b1a7","resolution":{"observed_at":"2026-05-16T13:10:57.611850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:0ee638e579d700dddac6ba07c98e308016b06edc95d3008d0a2d9b3b21d2bd9c","observation_id":"69071cf1-ea2a-41f0-b636-c806130a04da","resolution":{"observed_at":"2026-05-16T13:10:56.737621Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV)","venue":null,"work_id":"2df69d8c-5e40-4a30-b8b6-75b27848957e","year":2016},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c486492ffecc126ba5735b03fb4b13a4690f041520d9945060b9d11ed58a6ab3","observation_id":"a0e41b03-23e4-44f4-9025-879840fce802","resolution":{"observed_at":"2026-05-16T13:10:57.619094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision","venue":null,"work_id":"9177d3fb-60bd-44a4-9feb-8bd55c130030","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:7ae4fd2a89da178dd38b0e3ca17a0415fa15a21b73fdb0480c1b5cc59f137b75","observation_id":"a42441e3-423f-4393-8f34-56d2fa134908","resolution":{"observed_at":"2026-05-16T13:10:57.621580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV)","venue":null,"work_id":"0ea5581c-940f-49d7-a7da-a1b86fc0ba88","year":2022},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:1a955ee3a072707e7ec451f39ad3b80705017545cf18e3e07c72f08a687b6b74","observation_id":"cd6dc917-a95e-438b-a24c-b981569f3c02","resolution":{"observed_at":"2026-05-16T13:10:57.591576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on Multimedia (MM) (2023)","venue":null,"work_id":"7dd37ef3-bbec-472c-ab17-a0abf1ecf7ea","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:f5499b11754408c855469931f18795daeb6f3576a2f314620ccec3607e49bf03","observation_id":"fff80151-937a-4af2-bd96-e9fe936685d6","resolution":{"observed_at":"2026-05-16T13:10:57.623745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"c41795a9-b4ab-447f-af6e-691c97a67b06","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:d1547689f2182f8f7b07f5430e66f480834129d09e45cb38e18fde7eba1e8cd7","observation_id":"1d09fc3b-caed-4dd3-8d68-f08324997b17","resolution":{"observed_at":"2026-05-16T13:10:57.625998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:20:43.363972Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"33dbbad5-4b0a-4a6c-a878-325800bcfeaf","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:3a030b1e01761f7d56f00fe28a612680ebb0a11da9af2169e154924062cb15dd","observation_id":"8e0eb2c0-3a9e-48f4-b9aa-3da62be6e593","resolution":{"observed_at":"2026-05-16T13:10:57.586577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"1a777dd2-948e-453b-84b4-cdbd10734c5d","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:bb1204cc4423ebd227eb8cbf9141dcc43cf8672eee60b74b6d8d7a546891d1ea","observation_id":"16d83e56-4db8-439d-99a5-6d4e170db180","resolution":{"observed_at":"2026-05-16T13:10:57.587743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"eef0a6a2-7c42-4601-b5f7-d5444a36b691","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c0a1af2f5aa6b03bfa9c7a03c8397c3dad25114af73782e8c20764c3593905d0","observation_id":"db26aa49-bdb0-4431-a281-a926174af312","resolution":{"observed_at":"2026-05-16T13:10:57.593569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"c2d25ae5-055a-4b12-b781-c36d57091221","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:50376e528babea389e1eacb797201bd3c8c2b4d268651aab17a94c28b765b88a","observation_id":"ed0eae98-da38-42de-be17-6a7d87ad7f8d","resolution":{"observed_at":"2026-05-16T13:10:57.609352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"f59bdd3a-993c-4f22-a77a-3189548a9be8","year":2016},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:e3cae7892818c30b569f16314d43bdebb9945e32ac410030c7c1feaed4b3bfca","observation_id":"20af6d65-1e89-472a-acd5-e58e16de1f38","resolution":{"observed_at":"2026-05-16T13:10:57.591288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:9c83f719a3fd0816bfcd14c4567161c0da6e153e68af48b96a575e475204cf50","observation_id":"788a646b-dc6b-4146-8462-0d85452d4fd6","resolution":{"observed_at":"2026-05-16T13:10:56.706873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:55f82d5fb8d8127aaac4d4753cafe20225312e89c9d4573d59ede4d186ac1505","observation_id":"b8b534b6-04cd-42bf-b771-754bf3d6eb09","resolution":{"observed_at":"2026-05-16T13:10:56.740725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.358056Z","title":"Gtpo and grpo-s: Token and sequence-level reward shaping with policy entropy.arXiv preprint arXiv:2508.04349","venue":null,"work_id":"c337a3f9-8f7e-4f6a-b463-5f4193cee20b","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:fe2517098ea1a47450a08db841594c9efc5071ed80fe22c00720a98488581bc5","observation_id":"a39eb763-a5eb-4593-9e5d-205bccb1c8a0","resolution":{"observed_at":"2026-05-16T13:10:56.722822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:db79244af10dc218d9259970526a94277f670d24c521438e335d87434f4bcbbf","observation_id":"80558958-e0dc-4f5d-848f-b8ac3e96cea6","resolution":{"observed_at":"2026-05-16T13:10:56.728483Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:0dc64321c47ac29c345203e4e202b91f6dcc56e9e237aeec13df530fc5ac14fe","observation_id":"650fd6b2-170b-4c43-ab65-78ef70da1454","resolution":{"observed_at":"2026-05-16T13:10:56.746512Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:a699286549b3e4023108305d874ee652e43262826ca10cfa708e66a44fa76c2c","observation_id":"803bb090-7124-412a-ab9f-4a258a95aebc","resolution":{"observed_at":"2026-05-16T13:10:56.743529Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:bb96ce5b37d506ba91400de67f604c9291ed5694c843dee8b932b020c5a7774c","observation_id":"6c83cf21-5767-4c75-b8ee-c9aae01b99e8","resolution":{"observed_at":"2026-05-16T13:10:56.702965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:abc572f09ee8fb64a026fa09c54d6a55af660f469e0ccfde3fbc92408d45d90c","observation_id":"6a1c0a8c-c229-4107-baab-02f1846fb20c","resolution":{"observed_at":"2026-05-16T13:10:56.689386Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:32b4dcbb6617efb1180512cea4b883547d185fd66ad0cefcad1941d07975aeba","observation_id":"0af3fd9f-14c7-4f89-8c2d-17653cc9f45c","resolution":{"observed_at":"2026-05-16T13:10:56.692513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13439","last_updated":"2025-03-17T17:59:01Z","snapshot_observed_at":"2026-08-04T07:48:44.918544Z","submitted_at":"2025-03-17T17:59:01Z","title":"Amodal3R: Amodal 3D Reconstruction from Occluded 2D Images","version":1},"cited_work":{"arxiv_id":"2503.13439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13439","snapshot_observed_at":"2026-07-09T18:06:25.624991Z","title":"Amodal3r: Amodal 3d reconstruction from occluded 2d images","venue":"cs.CV","work_id":"5f1e6774-4328-400b-9d6a-928495d17d40","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2503.13439","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:ed819ce792d9b5fce4068bfea1732f8df8945fcab6ae2e72b9f91ac46d00df66","observation_id":"83fe5f8f-d0e0-4606-8235-a429a6b25ece","resolution":{"observed_at":"2026-05-16T13:10:56.707028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Journal of Computer Vision (IJCV) (2025)","venue":null,"work_id":"b296bf78-1f66-4bc4-86e3-6ddb2db89605","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:0e58f5a724e4a2146d2f2d3773929dc2d1dc4039839ae092111e9026ec7353c1","observation_id":"8b77253e-ecc1-4f49-b04e-4492587c300c","resolution":{"observed_at":"2026-05-16T13:10:57.602387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024)","venue":null,"work_id":"edfc3ece-28cb-4f89-bb0b-40d088249642","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:bf3e6de5932f15a1804893e43e1888af60e4f886bebde8a20f506bc726eb4379","observation_id":"2ff12b36-d25e-415f-ab4b-1d8e48e5c6ad","resolution":{"observed_at":"2026-05-16T13:10:57.571957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:5e083f32703c07629c01ec28eda86fadeb4b13bfbf76595cf8604e150507a9e3","observation_id":"50020c9f-6b63-4e53-82b8-2848c2951df9","resolution":{"observed_at":"2026-05-16T13:10:56.699161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE International Con- ference on Content-Based Multimedia Indexing (CBMI) (2025)","venue":null,"work_id":"ff0a71b7-a09a-4b3c-bcea-dbe7c74dd658","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:228ecfb48358f8b49288ae25430d70367ef762be36d3597babe4bec92d253ecc","observation_id":"37434e43-ec97-4df6-bc82-056928281abe","resolution":{"observed_at":"2026-05-16T13:10:57.574891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024) EGM 19","venue":null,"work_id":"a41d0cf9-39bb-4393-b0d3-d7c53e07e868","year":2024},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:1ed9378b48df54d1dc253f87dbc24d35eafcb8f99de45e632942e3452f1554d2","observation_id":"f473c917-b39a-41e4-b6e5-69eecd34e16f","resolution":{"observed_at":"2026-05-16T13:10:57.577825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"42006b06-4df3-4637-bfdb-ff7f096b8b84","year":2020},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:7bf3333b94d66fafd1b681eb539c5a85380a352f72cb39e93a5d870b8ce397f5","observation_id":"7ccb2ba9-ea63-445c-9ee6-61086bb3cab9","resolution":{"observed_at":"2026-05-16T13:10:57.566424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:de75accf26c942a858d6591b2b61c6056cc2093725eee8a2e301933886d581ca","observation_id":"baba472e-15bf-4990-85a9-1516a91fb7fa","resolution":{"observed_at":"2026-05-16T13:10:56.685410Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{question}","venue":null,"work_id":"770d1ff2-dd51-4b56-b6e0-bbe3aef26d2e","year":2017},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:1d0a488528a60d582714da1ff3f6681b1de052195504d76768f3080e4ec0bf25","observation_id":"cd3f772e-aa3d-4404-a03d-94a822547520","resolution":{"observed_at":"2026-05-16T13:10:57.637127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1938c1e-9e97-4c92-a81d-fe0096ce0c78","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:7ff6b90128b549ff119398187fee11224fd0e428ab0806791930da5e895c3c46","observation_id":"6547ba3f-a7f1-41d0-a6a7-0e4923cb688d","resolution":{"observed_at":"2026-05-16T13:10:57.639128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"the second/third/fourth xxx from left/right/top/bottom","venue":null,"work_id":"f37bd02e-a963-472c-9686-73faf94b1c5e","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:a826acacda59486d10e615632983869e4f98dac4b7f070c7bab310aee27fae25","observation_id":"8561e2fc-8969-4e6b-8df1-291603d19f4b","resolution":{"observed_at":"2026-05-16T13:10:57.563719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bebb2faa-228e-4760-b408-0651be8c1401","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:152083af44b22f386c850da6eb19a2d0c63e1289e999612f228134ce48dba76d","observation_id":"1a4f842c-8da4-4839-858b-6b76bc1b02dd","resolution":{"observed_at":"2026-05-16T13:10:57.628153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"the man in yellow coat","venue":null,"work_id":"5ec1382e-f15f-4a2b-b2a9-672901888969","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:56654fe588f43c72d8a9f02f879676c9d1d44afe8ebf308b285178593473ab35","observation_id":"9b543d76-e20b-4fb0-ab13-39313e2e9c80","resolution":{"observed_at":"2026-05-16T13:10:57.630277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1454bf0a-fc91-4a23-8c69-3110ed3c01ed","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:4e26c26e4d2567e08f0d0a622ddcf93e901747aaa7f8de069d7d32854a1add41","observation_id":"55f4ddcb-abfc-4e38-8cc2-385938014c2b","resolution":{"observed_at":"2026-05-16T13:10:57.632503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"567e452f-d26e-496b-9405-6c243c2914c8","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:0161deb36cf0d8646cc04bbb8565fb817c306adbcf9356c920d5e24da31e667d","observation_id":"bc65e258-d994-48fa-9b7f-79a6ae81e0da","resolution":{"observed_at":"2026-05-16T13:10:57.607436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"YES\" if the description uniquely and accurately identifies the TARGET region -","venue":null,"work_id":"009f843b-3971-4544-a430-f7e198fa248c","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:a00957e8d6210d7d4ef21e9999b9d4dad3a61dad984670a1cde1f313049ca74f","observation_id":"dfd2ddf3-682f-4c5c-acea-c1095bbb4296","resolution":{"observed_at":"2026-05-16T13:10:57.634900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7d305292-7878-4571-ad7b-196fec27245f","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:861c435db8b71bc9b3c60bec59a75b931490eb0c60870f96e08c112296b4a7a3","observation_id":"d165cc06-722f-4a60-9f3f-a43aa7955017","resolution":{"observed_at":"2026-05-16T13:10:57.550405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6444d326-9b12-4806-b5ab-f166c6ee2df7","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:80f02a520349111fba54a0786c7d7dcb176cb74b294230c7b551f8b368067b4f","observation_id":"eee4c9f9-958f-4392-a0cf-4f7d002a1a8d","resolution":{"observed_at":"2026-05-16T13:10:57.552967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"65b0ba5b-80da-4dd7-9f60-6209c71ae47b","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:73222c7eaee00e56489e7c76d70db77aa50f14664f252cd0905c4e1e7aba7066","observation_id":"57899d1d-061d-4301-93af-3c2633546d67","resolution":{"observed_at":"2026-05-16T13:10:57.540048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"slightly","venue":null,"work_id":"9e93f255-15ab-4414-9085-177f4061985f","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:ec7f9064db85b3f170acbb1a914e4fdf868bcf17bca9999439b7f2fe8901b844","observation_id":"2021a286-609b-48c4-8ad6-d0ee04cf3821","resolution":{"observed_at":"2026-05-16T13:10:57.542633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"sofa against the wall","venue":null,"work_id":"1faa5b5b-a27a-43f4-b6b3-a07cabf0b36d","year":null},"citing_paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T13:07:55.655699Z"},"links":{"citing_paper":"/paper/2601.13633"},"observation_digest":"sha256:c3023b34cc5971f051c91005e7b477ad4f78e1f50b780bd0b24670b50ffea5ce","observation_id":"4c51ddc9-50be-4398-a342-23277cb24cd0","resolution":{"observed_at":"2026-05-16T13:10:57.537439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.13633","last_updated":"2026-04-03T07:39:50Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T06:07:02Z","title":"EGM: Efficient Visual Grounding Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":13,"parse_uncertain":1,"unresolved":10,"verified_exact":6,"verified_fuzzy":29},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2601.13633."}