{"as_of":"2026-08-16T09:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d555acca920474a2f8d3a2a338b5b597bb840f2c92951af11b2a49d0e43e7fc1","coverage":[{"denominator":287,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:09:18.495392Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12748/citation-record","integrity":"/paper/2608.12748/integrity","json":"/paper/2608.12748/citation-record.json","paper":"/paper/2608.12748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.131394Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.131394Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7724de1d37c92c94da542b99789ed32f24218f7c02201d60fc582e1675c33c70","observation_id":"d5ada3e7-5e40-4954-926e-02eec0f49532","resolution":{"observed_at":"2026-08-16T00:09:18.131394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.135472Z","title":"Applied Sciences , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.135472Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f656a6f53c1c41ee4e76f0a990a7a2916480333fe9461d82a9deb019178c4601","observation_id":"a81588f9-4d07-4de5-8d0e-2e7ba330ccfe","resolution":{"observed_at":"2026-08-16T00:09:18.135472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.138865Z","title":"Signal and Data Processing of Small Targets 1993 , volume=","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.138865Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9db9bf30b3471855bb51d2f052770aa58cc6f44e4a96548a20a23a5ddf9652d2","observation_id":"7a1532a6-cb00-4695-8031-9a8beedf3cce","resolution":{"observed_at":"2026-08-16T00:09:18.138865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.143478Z","title":"Sensors , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.143478Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d5603ac1b31d168b85ea1d6de773d3e3c6ba3c8b1849d9a663064dce4f8c2351","observation_id":"3febe7c0-0ae0-40c8-80fe-e7aed9825ef5","resolution":{"observed_at":"2026-08-16T00:09:18.143478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.147495Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.147495Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:8dc4a89b412886be3eb015c5238a4550e935681e86ec54e7ab7559ed1e8d465f","observation_id":"f5a86670-90e2-4c0a-aba4-449af04cb6c5","resolution":{"observed_at":"2026-08-16T00:09:18.147495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.150786Z","title":"Sensors , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.150786Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:618ac5342f8ff1a3561e8a86b5d06a99902e8ac1e7ea80562c572e8f1f7b1b6a","observation_id":"cb5ff312-aa1b-4059-9149-a9c07845df58","resolution":{"observed_at":"2026-08-16T00:09:18.150786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.153828Z","title":"2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.153828Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:69b4d06f8334324f6d74594ef8fd63a7691d9608d973ce955b6eb54e44840c73","observation_id":"6cac7bdf-ef22-4c44-96bf-66fdb7166eae","resolution":{"observed_at":"2026-08-16T00:09:18.153828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.158526Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.158526Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:ae3e6f643eef2e0ef2e36f563960360a282802f31b37fd48f3afa3dd08939c42","observation_id":"c637ee4e-6a73-4ed3-acfd-8baccf73b7a7","resolution":{"observed_at":"2026-08-16T00:09:18.158526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.161713Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.161713Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:753665da716af9685948c51b5f2b09360979b32b2adb1a2638dfabe367e5e6c6","observation_id":"ee327802-dd29-482f-9599-43871f64980d","resolution":{"observed_at":"2026-08-16T00:09:18.161713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.166091Z","title":"International Journal of Computer Vision , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.166091Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:6d70ff70482dd38fe07eac19acaf72bc7968be789f59733c1523cd0d660bd04f","observation_id":"6713d00b-68a6-407a-ac83-7f0e7df22efd","resolution":{"observed_at":"2026-08-16T00:09:18.166091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.169235Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.169235Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:072e4271f78cb71bc5df804e0aea3da67f2fabe12a18d65258cf8b35f7922c3d","observation_id":"198ced30-915a-4898-b3d7-56b6f1096078","resolution":{"observed_at":"2026-08-16T00:09:18.169235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.173688Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.173688Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:8c1d3f73773d067f3e23e45e8da876a03631d023c90e3a8e42230c25a9ce3d8a","observation_id":"1ef4a677-338f-4948-8ef1-88dd4e14e538","resolution":{"observed_at":"2026-08-16T00:09:18.173688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.176903Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.176903Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9a877190438d95600ab360f904b57e91edc0efeffc032c658933bc2b9ca379a0","observation_id":"f40c3e1e-bc8a-4f09-ae70-5f1976c6468d","resolution":{"observed_at":"2026-08-16T00:09:18.176903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.180236Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.180236Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:b5ade3746eb5c9d1a91be0df96913a5953ff43922471f228c213114e6b7784a1","observation_id":"a44725a2-b514-444d-b8f9-0221777dcbf7","resolution":{"observed_at":"2026-08-16T00:09:18.180236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.183249Z","title":"International Journal of Computer Vision , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.183249Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:c12f02b7a124bb4c4d4ac297187db30a4fe74423f631c61dc93209e47bed2597","observation_id":"2384866c-174a-4bfc-b306-6b373233115a","resolution":{"observed_at":"2026-08-16T00:09:18.183249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.186095Z","title":"Infrared Physics & Technology , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.186095Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:4716e02131bcf9446862ffee0cb1329a055b1ff3e4c68c2f4cfee22aa012d0f5","observation_id":"3150fbd9-0146-4dc5-9f1e-09ffd12aff8c","resolution":{"observed_at":"2026-08-16T00:09:18.186095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.189270Z","title":"Kaur et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.189270Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:b1429778bac25b3471c4fd80ee46d581d099b8d4cae8a70075d7dfdcb1b851e4","observation_id":"a41111da-8d77-4612-a8ce-e501f6f99bfb","resolution":{"observed_at":"2026-08-16T00:09:18.189270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.192080Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.192080Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:48050881efb6d87ebe5f9721ece429d35370f9b0633af65015614fc044d85b47","observation_id":"ea7d1d10-5292-4302-826b-a1e991a320aa","resolution":{"observed_at":"2026-08-16T00:09:18.192080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.195382Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.195382Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:b1e60c5c57224d163cc74b19a7e23a73fb4b9b5979c8a975cf9d32881b089225","observation_id":"738f01d4-a2f8-47b3-8b23-7b6b60045d01","resolution":{"observed_at":"2026-08-16T00:09:18.195382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.199801Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.199801Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:4fa790337a3b36da0da4f55f039884ecacb8c15b8ec6c85c20509dc2ab083441","observation_id":"169abf66-44fd-43ea-a19e-a84eb2cf17fb","resolution":{"observed_at":"2026-08-16T00:09:18.199801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.203629Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.203629Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:a626d8951d7f255045ec36fc302a441a5bddf3ff5d505df13726eb84e299a25a","observation_id":"fb978c6a-5f8e-4476-9cb5-8f2be0c79f39","resolution":{"observed_at":"2026-08-16T00:09:18.203629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.206600Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.206600Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9ce022c5e2b94dcd229524bb5c4f90096e664f930586b7362e13cd98840525dd","observation_id":"6a3d78cb-6c88-43a7-8995-2200ec1fd3a1","resolution":{"observed_at":"2026-08-16T00:09:18.206600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.210068Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.210068Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:edb14addf79186f90286cb6d4b0e4d603836321c16b112dbe343cb8580b56c29","observation_id":"9e8b2e84-e73c-4461-91c4-9bf00688c6d6","resolution":{"observed_at":"2026-08-16T00:09:18.210068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.214296Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.214296Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d809405694189b9967fb806f6848b593d31447eff78065271d0a8c93c708e194","observation_id":"198ab2ef-01d2-41d7-923f-fb195d791173","resolution":{"observed_at":"2026-08-16T00:09:18.214296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.217495Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.217495Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e81501f9d3305a196cbca5cc9f89af849aad60c53172a6554d68fe4622709f79","observation_id":"790836ec-2a49-46b1-80d6-4ad9eb6be0a5","resolution":{"observed_at":"2026-08-16T00:09:18.217495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.221276Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.221276Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:6a04502051870299223329d5b85f2a6f78e056e432378f0d5258b72b6296a1c7","observation_id":"e5373747-d872-4110-aa85-a96428c7291d","resolution":{"observed_at":"2026-08-16T00:09:18.221276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.225163Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.225163Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7d8dec5417d81edf5df6aaae3f7e650b7f6bd2d77d35c85a9949f82c1ba05712","observation_id":"0af7ddf2-e113-46d1-9b70-d2ab4e6bab68","resolution":{"observed_at":"2026-08-16T00:09:18.225163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.228795Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.228795Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:49b936e077b567b4ab8cf60839fdbde50455d36822a525a189ae846ca1bb1171","observation_id":"a9b04ec1-e611-4fc4-9a3b-085206799bd3","resolution":{"observed_at":"2026-08-16T00:09:18.228795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.232127Z","title":"2024 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.232127Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:47d4044c5ecf2fdcf9d144ff6669bc0753e9c721fdf4e009c6b1e92c720a3cd2","observation_id":"7c113b82-daa2-47f6-aabb-a6533ce590bc","resolution":{"observed_at":"2026-08-16T00:09:18.232127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.235430Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.235430Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:df8629bd688965c5109f4480f86cfc541eddd21acfe5da851ce178f88e57a2a0","observation_id":"166969f3-0ec7-4d50-8c18-99cf64e4e238","resolution":{"observed_at":"2026-08-16T00:09:18.235430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.238598Z","title":"Visual Intelligence , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.238598Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d1236adc7209923f173f8c4e408e2d5fa626f90752f9a6b14e9a900ff280e5f3","observation_id":"631494c5-6dca-4ca1-a8b1-6655b275f04d","resolution":{"observed_at":"2026-08-16T00:09:18.238598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.241956Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.241956Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f682a608364089f3cac53d783226782b0c280834a5ff881e378a1d5a80719dd5","observation_id":"dd53a003-ce60-4e95-b197-78914fbff2e7","resolution":{"observed_at":"2026-08-16T00:09:18.241956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.245336Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.245336Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:326bebe799019cd403b8c305d6c039e0fe6ffe188cc9cdf1f13aa827d60756e6","observation_id":"a14fb8f5-6243-4fdc-85da-f6b0fde0383a","resolution":{"observed_at":"2026-08-16T00:09:18.245336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.248499Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.248499Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:3694071e0a46ad7bfa53e935a0199d8d2e216878af37e059bb6dcf42424429db","observation_id":"24ddecf9-0999-43a8-b6dc-1a18525ae5f2","resolution":{"observed_at":"2026-08-16T00:09:18.248499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.252010Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.252010Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:969e1fd01294bc37bbce886547e0f119930567791abf690acce1f965541aa492","observation_id":"38806458-f364-4829-b4fb-fc5b09da3680","resolution":{"observed_at":"2026-08-16T00:09:18.252010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.255311Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.255311Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:375aac03bfd127ffa6c29092c0aa64616da57fd3cef428fc8813d3e8c4863f71","observation_id":"47feca59-be9f-4838-aecf-0d40e502dc86","resolution":{"observed_at":"2026-08-16T00:09:18.255311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-16T00:09:18.259063Z","title":"arXiv preprint arXiv:2304.07193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.259063Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:ad2afd3a5d75399bffd7a38b0d3a82df357e24b7199c5ec819cf20a471ecb661","observation_id":"d0ff5c32-6006-4d1b-9c83-d82dc1017147","resolution":{"observed_at":"2026-08-16T00:09:18.259063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.266450Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.266450Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9024240bf140f80048b9ab0031f5cbd714eb58c6cea3c475247d76e412c626da","observation_id":"bbd3066d-cf2a-47a7-a5eb-dfda3484a6bf","resolution":{"observed_at":"2026-08-16T00:09:18.266450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-12T23:53:00.854564Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-16T00:09:18.269408Z","title":"arXiv preprint arXiv:2405.20985 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.269408Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f25ecc1e5eb5da2a63568eca6bd6e7cc5a5633254f39e6f82c646b178c1d13c1","observation_id":"ff44c456-9f22-4a7d-8893-38d52e44efd7","resolution":{"observed_at":"2026-08-16T00:09:18.269408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-16T00:09:18.273874Z","title":"arXiv preprint arXiv:2404.16994 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.273874Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d48031f98ddca24fd48cc2e0b82882f2a5af47a83bc9f8246b4b9b24dcfd1000","observation_id":"b413ac14-a37f-46c9-8167-fba1bd896f1f","resolution":{"observed_at":"2026-08-16T00:09:18.273874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01847","last_updated":"2016-09-24T01:58:59Z","snapshot_observed_at":"2026-08-14T21:53:59.472078Z","submitted_at":"2016-06-06T17:59:56Z","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01847","snapshot_observed_at":"2026-08-16T00:09:18.277272Z","title":"arXiv preprint arXiv:1606.01847 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.277272Z"},"links":{"cited_paper":"/paper/1606.01847","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:fb4ef0705dbd1972e72ff1c5afcab1f84d0f0bcffd1b98b83cb08404ac48e185","observation_id":"b8c98ffb-b1ff-4c18-a79d-eebcbcaeb8b9","resolution":{"observed_at":"2026-08-16T00:09:18.277272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.281345Z","title":"International Colloquium on Automata, Languages, and Programming , pages=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.281345Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:52640ad0ca9747c441ef6a9fb30e167be1b37d6925405b66fa68d8cf4e6e309b","observation_id":"f1431835-d342-4cc3-88c2-5a7d44c75e60","resolution":{"observed_at":"2026-08-16T00:09:18.281345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.285481Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.285481Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:08cdb286d932cd813e881269afb432dcb60ef3abbc250e30136295c2b619731a","observation_id":"ba2da6cd-5520-4f45-987b-2d330b2ec766","resolution":{"observed_at":"2026-08-16T00:09:18.285481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-08-14T20:45:55.731918Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-16T00:09:18.288993Z","title":"arXiv preprint arXiv:1707.07250 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.288993Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:ce5efe3773370d10f1ebd553981e75364faf294189e5ea7a722479d324bf5185","observation_id":"3033de1b-51b1-4341-b512-1827915139ba","resolution":{"observed_at":"2026-08-16T00:09:18.288993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.292484Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.292484Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:82fe36709bef5553eade9abe4a33a33f77dec328bbc92275e9c9093cae4da189","observation_id":"93cf72aa-8317-4099-b5b8-1fd6a6d3c3ac","resolution":{"observed_at":"2026-08-16T00:09:18.292484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-16T00:09:18.295725Z","title":"arXiv preprint arXiv:2305.13245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.295725Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:77a8dfa9cfc70a2765293ee2b476822e2064e8c24e04e950093baec3ae4c64c0","observation_id":"862e57a0-a390-4f67-8b7e-6b008c20bb70","resolution":{"observed_at":"2026-08-16T00:09:18.295725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-16T00:09:18.299513Z","title":"arXiv preprint arXiv:1911.02150 , year=","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.299513Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:185c21041b4029baa19af996b9c443b991569210e39c449249d7d5c34b6d0d0f","observation_id":"d13c8183-9b69-418d-9ef0-3948308fe9d1","resolution":{"observed_at":"2026-08-16T00:09:18.299513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.303079Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.303079Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:36f821034fcfb9b330f6f7e894eefbe9a8b874123b47b7ad62becd8883e1c8dd","observation_id":"b342f152-1b0d-45bf-8ac5-deeb7ca75eeb","resolution":{"observed_at":"2026-08-16T00:09:18.303079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-14T12:12:43.486524Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-16T00:09:18.306273Z","title":"arXiv preprint arXiv:1908.07490 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.306273Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e621e2c08aeaba8d8f4ed895f5094ae2837bce0440d5d036c7f3c46541174d9e","observation_id":"aeb73f93-bd3a-49a8-88a1-8b5313b2fb04","resolution":{"observed_at":"2026-08-16T00:09:18.306273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.309435Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.309435Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:95a81523a09f983c00afce6d16fb15ac996f112526a18e74b36b1fe5c221c19d","observation_id":"58aa6810-536d-42ef-8104-bda0302ae315","resolution":{"observed_at":"2026-08-16T00:09:18.309435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.313282Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.313282Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:5838655c098ba306fffda05110858a756eae272423e024a06e147d5c2fbd0411","observation_id":"20c76a08-459a-4705-bf22-b9973526bb4c","resolution":{"observed_at":"2026-08-16T00:09:18.313282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.316532Z","title":"Scientific reports , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.316532Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f4e5132f66404411003f3f45b45ca2d528cf5d0eaed662607f7ba0e71ac1c969","observation_id":"5c05fb9c-087a-4a51-a5f0-11564571a76e","resolution":{"observed_at":"2026-08-16T00:09:18.316532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.320625Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.320625Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:c82771445ad8403ee8e2f1b50d5c906d0855e29b0cb1238bfae7fe6ff9c5f577","observation_id":"434536f2-3d05-492c-9ff9-c499cacfbf0f","resolution":{"observed_at":"2026-08-16T00:09:18.320625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.324123Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.324123Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:a37469f248d1416a6340f8215dce12a98e5b186ec17135f606dbe060c3d19fc6","observation_id":"20aeb9fc-85c8-4089-b7b9-e16e7c68811d","resolution":{"observed_at":"2026-08-16T00:09:18.324123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T00:09:18.327291Z","title":"arXiv preprint arXiv:2312.00752 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.327291Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:4e4dc824b437a62ea0f381ea1773a0440969f3d6d8730eddb95a87b7e2859591","observation_id":"4f1fd045-68ac-451c-992e-7c6c08929aa8","resolution":{"observed_at":"2026-08-16T00:09:18.327291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-16T00:09:18.330658Z","title":"arXiv preprint arXiv:2307.08621 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.330658Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d6b6ca91ae4527364485c2fce85f37330f19df8973b1b3c1e16e12a162a7831d","observation_id":"fe591112-dc85-4e93-b70f-bc762eb20c72","resolution":{"observed_at":"2026-08-16T00:09:18.330658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-14T04:57:43.972237Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-16T00:09:18.334068Z","title":"arXiv preprint arXiv:2305.13048 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.334068Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:4e891bfd8db536a40894d3eb1376f0ff69240b03aef1a3205aff0c17b6aea2fb","observation_id":"834b29cc-6fe3-49c8-a74f-c1a1d8b1ec3d","resolution":{"observed_at":"2026-08-16T00:09:18.334068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06457","last_updated":"2026-06-24T00:07:31Z","snapshot_observed_at":"2026-08-14T00:11:56.379317Z","submitted_at":"2025-07-08T23:54:11Z","title":"A Systematic Analysis of Hybrid Linear Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06457","snapshot_observed_at":"2026-08-16T00:09:18.338225Z","title":"arXiv preprint arXiv:2507.06457 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.338225Z"},"links":{"cited_paper":"/paper/2507.06457","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:53793da1190b90103275ffc93d077ca0561f52ad0bb7fb25d6554f156131c060","observation_id":"037c8e0f-fe59-4ff0-89cc-69a691be0dea","resolution":{"observed_at":"2026-08-16T00:09:18.338225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T00:09:18.342324Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.342324Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:c5cb35c6001f39e0d1d8ea0a7df6dd9c64cf661dc83bb400ec01c463b351161b","observation_id":"b631e196-28cc-4f9c-b96d-fe9e23d8d46b","resolution":{"observed_at":"2026-08-16T00:09:18.342324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.345488Z","title":"IEEE Transactions on Knowledge and Data Engineering , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.345488Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:ba83111cc966a5783cc1f16d328a4d3086e84b41971575b47ef3464f63439bc0","observation_id":"0be8a52b-9bda-4cc7-bec2-dc520ed3ac70","resolution":{"observed_at":"2026-08-16T00:09:18.345488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06670","last_updated":"2019-02-22T18:38:15Z","snapshot_observed_at":"2026-08-14T18:39:08.324821Z","submitted_at":"2018-08-20T19:52:51Z","title":"Learning deep representations by mutual information estimation and maximization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06670","snapshot_observed_at":"2026-08-16T00:09:18.348668Z","title":"arXiv preprint arXiv:1808.06670 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.348668Z"},"links":{"cited_paper":"/paper/1808.06670","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:72b2ca57380de8ab60b36bc5113af8467ed0acf9f001357949499e2ae1e45dce","observation_id":"ae418849-8255-46b7-b87d-7f14f0bec818","resolution":{"observed_at":"2026-08-16T00:09:18.348668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.352825Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.352825Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e8ad20b9f90255a8d9e14af4c73c3eebcefbd82bde656fe98ef5292f883434eb","observation_id":"173da82d-718b-401c-ba00-c9b11063f096","resolution":{"observed_at":"2026-08-16T00:09:18.352825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15352","last_updated":"2025-06-09T08:05:39Z","snapshot_observed_at":"2026-08-07T16:51:31.344576Z","submitted_at":"2025-03-19T15:51:17Z","title":"Towards Achieving Perfect Multimodal Alignment","version":2},"cited_work":{"arxiv_id":"2503.15352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15352","snapshot_observed_at":"2026-08-16T00:09:20.148078Z","title":"Towards Achieving Perfect Multimodal Alignment","venue":"cs.LG","work_id":"b5ff28e9-756f-4ff4-9d76-981309422d40","year":2025},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.356102Z"},"links":{"cited_paper":"/paper/2503.15352","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:0999cde9983746c2e69f30c426c85ee507bcc41a3f1e4b3cd3b0d86058f4892f","observation_id":"c8d034c2-0382-4b57-95fc-bebd575fd027","resolution":{"observed_at":"2026-08-16T00:09:20.152184Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16832","last_updated":"2024-07-21T18:11:34Z","snapshot_observed_at":"2026-08-15T14:59:35.339217Z","submitted_at":"2024-02-26T18:56:48Z","title":"Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16832","snapshot_observed_at":"2026-08-16T00:09:18.359522Z","title":"arXiv preprint arXiv:2402.16832 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.359522Z"},"links":{"cited_paper":"/paper/2402.16832","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:d98d054c4f99a3bcaa20dec6bf89c5681ca48411fae5e93690fef1ca0d1eea87","observation_id":"94bcdb0f-c482-477f-bbbd-02555ecee220","resolution":{"observed_at":"2026-08-16T00:09:18.359522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.362682Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.362682Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:be9a685c82570810da5426eb3191b82f7d629cac7690795c79ceea627fd76c8c","observation_id":"6cddadf8-7db4-4e33-b6a6-4492a9084913","resolution":{"observed_at":"2026-08-16T00:09:18.362682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.366327Z","title":"IEEE Transactions on Visualization and Computer Graphics , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.366327Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7b67f5346d2819549581dbfdb15a16afe4b9f7043a8dd726cf8d568a92061ad7","observation_id":"d0c07504-d2c5-4e3e-8e0b-66e28e7418a5","resolution":{"observed_at":"2026-08-16T00:09:18.366327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.370409Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.370409Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7b68af21c18d7f9f0f0bc12057ca76b03324d00812d992f677c0d81dd6e08745","observation_id":"294af071-c99c-47f8-9fba-cfcf71802ec3","resolution":{"observed_at":"2026-08-16T00:09:18.370409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02875","last_updated":"2024-08-05T14:01:26Z","snapshot_observed_at":"2026-08-13T04:03:09.793739Z","submitted_at":"2024-03-05T11:38:48Z","title":"Enhancing Conceptual Understanding in Multimodal Contrastive Learning through Hard Negative Samples","version":2},"cited_work":{"arxiv_id":"2403.02875","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.02875","snapshot_observed_at":"2026-08-16T00:09:20.129397Z","title":"Enhancing Conceptual Understanding in Multimodal Contrastive Learning through Hard Negative Samples","venue":"cs.CV","work_id":"0b069419-d4d7-4ba0-b581-be32b06dc7ea","year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.375123Z"},"links":{"cited_paper":"/paper/2403.02875","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:387bf1c96683a77a7c3d1f43d1ee8a513bb29988b5c9ca7cbbc636c29a38fa46","observation_id":"76608d80-5443-43ae-a212-acd4d5b81c2b","resolution":{"observed_at":"2026-08-16T00:09:20.132947Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.378889Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.378889Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:52da743a8b976343daa86fc58abc8948ac934b7361dcc29b1bd70a24f08ebde4","observation_id":"3663de83-66cc-40f6-80e1-6fc00da5e1fa","resolution":{"observed_at":"2026-08-16T00:09:18.378889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.382502Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.382502Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:3f89dfa4406ce12c3604f76d54b95c13fe81354e49134edcec97cbb6f3099c57","observation_id":"9a27dc3a-387a-424d-80b6-d1842df26b8f","resolution":{"observed_at":"2026-08-16T00:09:18.382502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-16T00:09:18.386507Z","title":"arXiv preprint arXiv:1807.03748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.386507Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:0b39ff7e59186b428527ce05771d5dcc73721974c8237254016f1e0fb53b58f4","observation_id":"582bd7ee-ebb1-42f8-9fe3-c54da476fd65","resolution":{"observed_at":"2026-08-16T00:09:18.386507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T00:09:18.390945Z","title":"arXiv preprint arXiv:2010.11929 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.390945Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:3e97c56ef4462a3b4599487bb4011858e4ca675c09ce703ec616a7576121cf2a","observation_id":"3f693ce0-b55d-4375-ace4-aff1f1285ad5","resolution":{"observed_at":"2026-08-16T00:09:18.390945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.394896Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.394896Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:cd1a28abafa7bca6c497cdb2517af3fdf1d2c3480b48740a8e42be5ae1bf0154","observation_id":"807fff39-ebf6-415e-8287-d348b5d9300c","resolution":{"observed_at":"2026-08-16T00:09:18.394896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-15T14:49:08.287205Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-16T00:09:18.398783Z","title":"arXiv preprint arXiv:2004.00849 , year=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.398783Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:6a50dc63c2bc62a6fdaf39c93543fd6300e753c4c2282bfb1343940941510d78","observation_id":"84c5ce49-402f-46c9-a776-285a972c0e64","resolution":{"observed_at":"2026-08-16T00:09:18.398783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14347","last_updated":"2025-05-15T15:52:39Z","snapshot_observed_at":"2026-08-15T15:42:34.420849Z","submitted_at":"2024-11-21T17:42:20Z","title":"DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14347","snapshot_observed_at":"2026-08-16T00:09:18.403553Z","title":"arXiv preprint arXiv:2411.14347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.403553Z"},"links":{"cited_paper":"/paper/2411.14347","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:6c5afc5e04df2d6e4f3ebf316d255326d2b484facaf0c533622b243f61de7299","observation_id":"c6fa70a8-fc79-469b-963b-e9ce45a69b42","resolution":{"observed_at":"2026-08-16T00:09:18.403553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-13T00:27:10.979145Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-16T00:09:18.407130Z","title":"arXiv preprint arXiv:2405.10300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.407130Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e1e2d6b07e03f13c9e75b4a190e1f2ba2856d7d475aa2c23dc304930e89d743c","observation_id":"61759e2c-5b3e-42ff-a09e-69345ff19fa6","resolution":{"observed_at":"2026-08-16T00:09:18.407130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.410782Z","title":"arXiv preprint arXiv:2503.07465 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.410782Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:050498458128b9122d3a659a5e021c090d42b16d4f8e9c222242a45ac94ee2a3","observation_id":"f235c6f8-8702-4b7f-a42a-dd3fdcfcf2b1","resolution":{"observed_at":"2026-08-16T00:09:18.410782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.414921Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.414921Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:a2e71404747fb2e6b74c787efd1c3abd9ce693da3de74d8c6d2be51ed96f827d","observation_id":"757268e6-1c12-4301-ad2b-0de76dddf4d6","resolution":{"observed_at":"2026-08-16T00:09:18.414921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.418075Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.418075Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:b0a2059138ef2628b1775eb8edb0719bcab10abc642abbcaa6d6c552d6183b10","observation_id":"f442bf30-05d6-41d0-ab8f-0d770b481288","resolution":{"observed_at":"2026-08-16T00:09:18.418075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.421565Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.421565Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:8d8955e9902df97368635a93605bb1f5160d5d225ec4aa22c5099ad674bfa5ac","observation_id":"4a822874-dff6-4f9a-9e56-ec55b0e4d893","resolution":{"observed_at":"2026-08-16T00:09:18.421565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.424416Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.424416Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:014a11b10a9c26ec06b8536de19cf51f19b47edf057b416d3e4752afd185e6df","observation_id":"e908ccd2-a150-485d-bceb-743d546d6521","resolution":{"observed_at":"2026-08-16T00:09:18.424416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.427521Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.427521Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f2cbf8699d7ecacade013353371dab0faf4e62d65c6de8ddb683849d987e3897","observation_id":"94186c65-14e1-4ef6-9934-bd93689fb394","resolution":{"observed_at":"2026-08-16T00:09:18.427521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-16T00:09:18.431661Z","title":"arXiv preprint arXiv:2104.13921 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.431661Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:6577f5007955423e08ce47caca395dc482c2da7e7048be4c59f3662c5f86f512","observation_id":"b545fd16-3ec7-416e-9ce4-00c77ae285a1","resolution":{"observed_at":"2026-08-16T00:09:18.431661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.435447Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.435447Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:e51ad4881ad861f7cfe69d1861bd84f331228dbef805e83cc9ac09fb85408e82","observation_id":"3e262bb6-28bc-4f79-872e-2f0e029ba1dd","resolution":{"observed_at":"2026-08-16T00:09:18.435447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.439386Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.439386Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:b2b90337c9542a6e01c34387980b7300d5254011d012528834408c3fd4b84e24","observation_id":"aa95a6b9-2d9d-4569-9f10-9f499d54cb9f","resolution":{"observed_at":"2026-08-16T00:09:18.439386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.443344Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.443344Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:afd39899ca3038e6d9798453e06dd73b5332e005f7e10deaac68973464215aa0","observation_id":"16e0af0a-7474-46f1-97c5-a6ce637d7988","resolution":{"observed_at":"2026-08-16T00:09:18.443344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-16T00:09:18.447397Z","title":"arXiv preprint arXiv:2505.20279 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.447397Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:46febbc87b1eb30b62c4f8a5b302a186555bbf5a395ba3a26e7c047a7040ee9c","observation_id":"58e84b30-1e5e-4bfc-82ff-4a46363cabb2","resolution":{"observed_at":"2026-08-16T00:09:18.447397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-14T21:31:53.057652Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07295","snapshot_observed_at":"2026-08-16T00:09:18.451539Z","title":"arXiv preprint arXiv:2509.07295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.451539Z"},"links":{"cited_paper":"/paper/2509.07295","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:fd2dcfdd765bde364bd61c4d7ed69d3ca2b01aea2564132d5837f6d8054be40e","observation_id":"fa101d85-636c-47f0-9dc6-9f4878968d35","resolution":{"observed_at":"2026-08-16T00:09:18.451539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-08-12T22:24:44.610290Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-08-16T00:09:18.454827Z","title":"arXiv preprint arXiv:2410.09575 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.454827Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:9b3b4cac3eddde294eed083d0cab04d9dda3619e0c9e3b18135dd85259abb030","observation_id":"c4606724-0164-4c2d-921f-7e9932cb4b89","resolution":{"observed_at":"2026-08-16T00:09:18.454827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.458692Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.458692Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:7fbaa7feadfabe175dfa34fe99ac1bbf944e4ede79881ad08ec9dc4b4df4f8d4","observation_id":"b9059908-295c-4d50-99aa-3e19fd988604","resolution":{"observed_at":"2026-08-16T00:09:18.458692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.462406Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.462406Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:5da13ecca100a3de561f08417446097fb5a77f6aa52f891412bbf716bf6672e7","observation_id":"b044f2a9-f4b1-4c70-bb86-18d3710013ed","resolution":{"observed_at":"2026-08-16T00:09:18.462406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08381","last_updated":"2024-03-10T19:00:00Z","snapshot_observed_at":"2026-08-13T05:50:35.656851Z","submitted_at":"2023-10-12T14:55:31Z","title":"AutoVP: An Automated Visual Prompting Framework and Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08381","snapshot_observed_at":"2026-08-16T00:09:18.465655Z","title":"arXiv preprint arXiv:2310.08381 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.465655Z"},"links":{"cited_paper":"/paper/2310.08381","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:fe2b289b36d5f3aa7dbe859a073ddd5ad173f1310ff619db8d7fb47278c5f9f4","observation_id":"2305c43d-1a7b-475a-bb5b-92fcffeac25e","resolution":{"observed_at":"2026-08-16T00:09:18.465655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.468974Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.468974Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:f2e9282c201c995d8f19265274eadae8b62ef9511a42700ed9f68858a14e559b","observation_id":"2098a7e2-3c1e-42b0-ad3d-8915e61b50df","resolution":{"observed_at":"2026-08-16T00:09:18.468974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-14T03:15:48.310538Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-16T00:09:18.472945Z","title":"arXiv preprint arXiv:2203.17274 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.472945Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:053805c110546f063e279547cea89666855630ec49cc3b9c14fc155a78f21060","observation_id":"5a7ef476-59b4-47a5-a3ba-43babdb96744","resolution":{"observed_at":"2026-08-16T00:09:18.472945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.477311Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.477311Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:181d3edb162044dc335301b312f1570fc2a37bcbdddfc3d9dcbeae258837a40f","observation_id":"7b18dd3c-38af-4f9b-a832-10a6e057418e","resolution":{"observed_at":"2026-08-16T00:09:18.477311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.480340Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.480340Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:28df884f16b92136ac430139d9b5d245dee5d31a1998592519638376f7511e30","observation_id":"6b4b153e-f91d-494f-b8b1-5e528e43d0a3","resolution":{"observed_at":"2026-08-16T00:09:18.480340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-16T00:09:18.483633Z","title":"arXiv preprint arXiv:2101.00190 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.483633Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:96a7cc75fc33e1c680e418c29226502d355d7fcda56ec5b7318882d67b7f7aca","observation_id":"35dfea57-56f9-4d8f-a039-9ece697abcb4","resolution":{"observed_at":"2026-08-16T00:09:18.483633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-16T00:09:18.487512Z","title":"arXiv preprint arXiv:2104.08691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.487512Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:49bec1f402d76587ae45e50f7733a4312564fe5fe1d3464ec25f0e5de1225516","observation_id":"431e6702-d31f-4fcf-be6d-7a75c5fa7469","resolution":{"observed_at":"2026-08-16T00:09:18.487512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-14T08:27:33.738990Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-16T00:09:18.491464Z","title":"arXiv preprint arXiv:2110.07602 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.491464Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:5ac488116bbe5bdc69704482a5e68c6642a5c7b0750ab0a62d3f8fa0235c0e2f","observation_id":"c7c9fe7d-7655-4784-8ee2-dc942b7961f6","resolution":{"observed_at":"2026-08-16T00:09:18.491464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:09:18.495392Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.495392Z"},"links":{"citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:0a32adc6eaf186174a47a23a001ba16081b65b36b09839bd2e88f66193220938","observation_id":"e587b3c4-fedd-4f32-9535-011c1aad0ba1","resolution":{"observed_at":"2026-08-16T00:09:18.495392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:10:22.465233Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":98,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":287},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 287 outbound references and 0 inbound Pith citation observations for arXiv:2608.12748."}