{"as_of":"2026-08-10T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8aa929775697ee118640945f8627083a3265e10b12ef1ad047287a0b742b5928","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:56.642103Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:40:10.108333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T22:44:01.449286Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"cited_work":{"arxiv_id":"2505.21549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21549","snapshot_observed_at":"2026-06-29T22:44:01.449286Z","title":"arXiv preprint arXiv:2505.21549 (2025)","venue":null,"work_id":"4339d435-4ad2-4245-b4f1-ae058c618d9d","year":2025},"citing_paper":{"arxiv_id":"2511.13415","last_updated":"2026-05-09T06:27:59Z","snapshot_observed_at":"2026-07-06T22:36:00.635873Z","submitted_at":"2025-11-17T14:28:41Z","title":"Attention Grounded Enhancement for Visual Document Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T20:53:15.920563Z"},"links":{"cited_paper":"/paper/2505.21549","citing_paper":"/paper/2511.13415"},"observation_digest":"sha256:dd77d0b12ce95e5e3a6ac3cdd45584a5c43f61a9dc275fc51c5858c9f99a3da0","observation_id":"ceb08927-47a9-44d3-8dfd-84f2b575e608","resolution":{"observed_at":"2026-05-17T20:55:15.283513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"cited_work":{"arxiv_id":"2505.21549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21549","snapshot_observed_at":"2026-06-29T22:44:01.449286Z","title":"arXiv preprint arXiv:2505.21549 (2025)","venue":null,"work_id":"4339d435-4ad2-4245-b4f1-ae058c618d9d","year":2025},"citing_paper":{"arxiv_id":"2603.25383","last_updated":"2026-04-22T09:05:30Z","snapshot_observed_at":"2026-07-06T22:50:37.468743Z","submitted_at":"2026-03-26T12:34:18Z","title":"CLIP-RD: Relative Distillation for Efficient CLIP Knowledge Distillation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T00:20:36.975106Z"},"links":{"cited_paper":"/paper/2505.21549","citing_paper":"/paper/2603.25383"},"observation_digest":"sha256:9ab39b6066faf10197d85555e5adac8c7e1040c942836ce1b73c5708a44cf7a0","observation_id":"5f077924-f68a-414c-b070-b612d00c08d5","resolution":{"observed_at":"2026-05-15T00:23:22.850024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"cited_work":{"arxiv_id":"2505.21549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21549","snapshot_observed_at":"2026-06-29T22:44:01.449286Z","title":"arXiv preprint arXiv:2505.21549 (2025)","venue":null,"work_id":"4339d435-4ad2-4245-b4f1-ae058c618d9d","year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-10T00:40:01.591409Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"cited_paper":"/paper/2505.21549","citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:0b3154a773dbe5715545aa3260aa6b3a8885bfb2b8ce2ade66b8c74eb8d5aded","observation_id":"cf5c23bd-f9bd-449a-aa6d-c135d760bb0e","resolution":{"observed_at":"2026-06-29T22:44:01.450876Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21549/citation-record","integrity":"/paper/2505.21549/integrity","json":"/paper/2505.21549/citation-record.json","paper":"/paper/2505.21549"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:06.235398Z","title":null,"venue":null,"work_id":"a8d6bf89-e493-4e1c-9579-1f056f0a75cd","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.618904Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:631ab8101ae350295f6490900e82251bd9dd848e38903e46464ea86de3a04d34","observation_id":"77803a8b-ef8f-4d1f-af23-efba41f6513a","resolution":{"observed_at":"2026-08-07T14:26:06.306261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:06.083399Z","title":null,"venue":null,"work_id":"ed2bf61e-6f6d-484a-a7e4-1fdd43594cd7","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.704353Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:edeff556aafae0d9e5ee6c1fde38ea8db52be00344a7c087b5abc2b84ae2d0cf","observation_id":"5c69eb8b-a10f-4467-8f9d-99bbdd9df984","resolution":{"observed_at":"2026-08-07T14:26:06.158309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-09T19:43:52.666104Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-07T14:25:52.768260Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.768260Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7efa87daec0d3b32ad48cbbf1e118f7ad5ac4a297ce3cf3ec91dfb40d904c617","observation_id":"816bed74-d1f1-4642-bb44-4ad8b8361707","resolution":{"observed_at":"2026-08-07T14:25:52.768260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.975434Z","title":null,"venue":null,"work_id":"d87697fa-f9da-418a-85d0-f11e12b48977","year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.802193Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:17678ea1c7ce5cbcf40039450293e9ca83a5a1fa4edd4208aa91996b647cb86c","observation_id":"de01a239-138b-4e74-822f-d631754fd328","resolution":{"observed_at":"2026-08-07T14:26:06.025551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03700","last_updated":"2025-01-09T09:12:06Z","snapshot_observed_at":"2026-08-04T10:20:08.342718Z","submitted_at":"2023-12-06T18:59:19Z","title":"OneLLM: One Framework to Align All Modalities with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03700","snapshot_observed_at":"2026-08-07T14:25:52.851020Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.851020Z"},"links":{"cited_paper":"/paper/2312.03700","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:b8349789d346301a5a4082eaffd47d529bec84d57fdb55457c486c1881761e9b","observation_id":"800823cb-a109-4a0f-87e9-f8838e1f2a34","resolution":{"observed_at":"2026-08-07T14:25:52.851020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03640","last_updated":"2023-03-26T11:40:16Z","snapshot_observed_at":"2026-08-07T01:42:48.593126Z","submitted_at":"2022-12-06T18:59:58Z","title":"Fine-tuned CLIP Models are Efficient Video Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03640","snapshot_observed_at":"2026-08-07T14:25:52.953445Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.953445Z"},"links":{"cited_paper":"/paper/2212.03640","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:5ed9c8a98080101475ec33b9aa4b5e7e5f694ec21a61139e1479252c9b092762","observation_id":"804f3574-872c-418b-b0e9-eceab72a7017","resolution":{"observed_at":"2026-08-07T14:25:52.953445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.835752Z","title":null,"venue":null,"work_id":"ccd80847-5aa1-4ae5-b385-bef2667c856b","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.084531Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:6d5c22c93c0d8edb3491b8d4272a4d2fffcfceda048d4566819e1383f9670507","observation_id":"3450a384-c6eb-4f7a-ac1e-d8c9337fb875","resolution":{"observed_at":"2026-08-07T14:26:05.879497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.644729Z","title":null,"venue":null,"work_id":"2d5424af-6635-4ca4-9148-e5470844def5","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.248527Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:143af9aead3ee5be3fe78e5c1bb69ddff891e06d131f05c3e3b08b6aabbda11e","observation_id":"27b72cf7-f33f-4447-afe4-bc09a9de8898","resolution":{"observed_at":"2026-08-07T14:26:05.760485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.445452Z","title":null,"venue":null,"work_id":"add22c4a-6dbd-41a3-a07c-f35ddf867667","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.383904Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:6888fb9cf7f6938a48b6e6c35ff850e6fd21788d95293ec1e910885dcd03b5cc","observation_id":"f2966392-8830-4c7e-a7ff-29b3f672cff8","resolution":{"observed_at":"2026-08-07T14:26:05.554551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.285545Z","title":null,"venue":null,"work_id":"623dc46b-377d-4db0-9b1e-b1c0a3591f7b","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.405358Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:e2c9ded7452043b4cafda6c9ebbe2c63ac3c350f5e8846ff75e96bbc824d5e04","observation_id":"46c10d89-9397-4191-a058-6bbd53ef6263","resolution":{"observed_at":"2026-08-07T14:26:05.353313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.991836Z","title":null,"venue":null,"work_id":"b491e0d1-15e6-4119-90ab-27a7556e915d","year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.432732Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:8c08208a3a24ea2ebb8364535443d9efe05912370f923d355bf3ec614056287d","observation_id":"5f406df9-9ea2-4698-a141-5f13ad5275f0","resolution":{"observed_at":"2026-08-07T14:26:05.145186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.742208Z","title":null,"venue":null,"work_id":"36e5a3de-884d-4c84-82b4-b3172355b653","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.468328Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:6412d252f5c0e0ff7d2d29b8c8254b08c38a12e2d616f29ca1cf554981a4a8f8","observation_id":"e6aeb35b-de0b-4a99-8a64-13ff5de7c655","resolution":{"observed_at":"2026-08-07T14:26:04.837451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T14:25:53.489390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.489390Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:cf6bf6b7cf394f8c610fd0cdad258568feea88c6d27e9e616c398829cb75121c","observation_id":"787ccc01-f743-44f5-813f-312dc182a607","resolution":{"observed_at":"2026-08-07T14:25:53.489390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09707","last_updated":"2024-04-15T12:06:00Z","snapshot_observed_at":"2026-08-04T13:38:45.190068Z","submitted_at":"2024-04-15T12:06:00Z","title":"Adaptive Patching for High-resolution Image Segmentation with Transformers","version":1},"cited_work":{"arxiv_id":"2404.09707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09707","snapshot_observed_at":"2026-08-07T14:25:57.660151Z","title":"Adaptive Patching for High-resolution Image Segmentation with Transformers","venue":"cs.CV","work_id":"4084de9b-0c43-4ba2-8250-a50461eff800","year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.542586Z"},"links":{"cited_paper":"/paper/2404.09707","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:dab1ddb1f36c43f77c87989811bbefefa7c71fccd07265c205bbc3ba60badfcb","observation_id":"e405f21c-933b-4842-a1f0-0ed22870de11","resolution":{"observed_at":"2026-08-07T14:25:57.743944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.469450Z","title":null,"venue":null,"work_id":"8517ce42-6094-460f-b964-2c9bcbcd0a61","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.632149Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:90c968c3954051d8a353ca0ac9443220b3fa4d2989dfc1334bbab6d517da6b0d","observation_id":"a751ab19-f26d-4c53-b13f-aad7128a0eaf","resolution":{"observed_at":"2026-08-07T14:26:04.618452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.260428Z","title":null,"venue":null,"work_id":"cf782dfc-f977-4de3-b1f0-392ee27116b8","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.672898Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:70f6cabec218ca3e22440977537202ce5d22e342ca6325d8f1833a27fcfe3994","observation_id":"297f96f3-5860-4e34-8808-6dbcca327c9c","resolution":{"observed_at":"2026-08-07T14:26:04.321137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.122564Z","title":null,"venue":null,"work_id":"9b216670-212e-4976-8571-fc8fba2e047f","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.723917Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:57cce7c82735c1ce781a25293a90f99c92f67278ca2659463ff3f302ffc90893","observation_id":"780ba6ee-7f08-4364-b80c-d7e3d43f92be","resolution":{"observed_at":"2026-08-07T14:26:04.198900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.959862Z","title":null,"venue":null,"work_id":"1853f4ea-8e5c-46ad-a101-6e6c1e9ff6d2","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.758721Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:aac8ab76fa781d7344c5ebdb4a4fbfb300147c0f31cc01df4456ddd50289f691","observation_id":"6832ad51-1f35-4c4d-86c4-92a27ac9efb8","resolution":{"observed_at":"2026-08-07T14:26:04.057432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.721645Z","title":null,"venue":null,"work_id":"1cbed41e-3450-4b65-a1ca-a19039c3fea8","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.914668Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:679203625629ff7e1200115319f0ba1b38b90376caff57a9703fdb8931302796","observation_id":"f7e3fe60-a62c-4576-a329-6aaae5b529a7","resolution":{"observed_at":"2026-08-07T14:26:03.835529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.469489Z","title":null,"venue":null,"work_id":"faad5475-1cea-4bf3-9372-3fa6a936df51","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.958792Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:1dbf96ccc208fbb59e51efa3b67f886a24f5d668daf1b7e194c62b7d71d1277d","observation_id":"430b1839-d9e6-4bbe-bf4a-89e8ef83464b","resolution":{"observed_at":"2026-08-07T14:26:03.577939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.265944Z","title":null,"venue":null,"work_id":"1a89c6f2-510b-4652-b39b-25e49d11822b","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.028691Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:6782909286047fdf48bc5f8e2eadeb5b45df4e3e70d8e2820714e876cf4f1649","observation_id":"45862c8c-ebf5-43cd-a029-9407abf21db4","resolution":{"observed_at":"2026-08-07T14:26:03.368362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.051936Z","title":null,"venue":null,"work_id":"b40118c4-7f37-4d07-9792-5c09dbac5926","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.085809Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:cad4cc10e08cf8a41ac95225edf26fb770ddc54323d362c7b39439d2b7a59a29","observation_id":"8ca12903-9f93-412f-8dbd-fa962f3b6807","resolution":{"observed_at":"2026-08-07T14:26:03.184792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:02.841666Z","title":null,"venue":null,"work_id":"5062db41-1e9b-40a3-8a41-2110a56fbc93","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.174626Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:9aa93e8d62ddc5aabe02e218ac49cbf63a1abb3bf47e9f68883a7770927e3a56","observation_id":"937a579d-9daf-45f4-9340-f349e0ef23f4","resolution":{"observed_at":"2026-08-07T14:26:02.959638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.11191","last_updated":"2020-08-25T17:49:25Z","snapshot_observed_at":"2026-08-10T02:18:15.192772Z","submitted_at":"2020-08-25T17:49:25Z","title":"Multi-team Formation using Community Based Approach in Real-World Networks","version":1},"cited_work":{"arxiv_id":"2008.11191","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.11191","snapshot_observed_at":"2026-08-07T14:25:57.497151Z","title":"Multi-team Formation using Community Based Approach in Real-World Networks","venue":"cs.SI","work_id":"6af3e722-de74-4e6b-99ee-f26a36d4ea0e","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.233395Z"},"links":{"cited_paper":"/paper/2008.11191","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:80d0d25b517ea0ae1c8248d47267b6c89e389a0c39be6f48bc4c949b5ebf739e","observation_id":"45c7df7a-63dd-4d3a-9a20-652cccfc4121","resolution":{"observed_at":"2026-08-07T14:25:57.521180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T14:25:54.298722Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.298722Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:0db89e31e4dcca37bd9705346b0ffcc467081f2ea3fcfaf3c447275aaa711226","observation_id":"eb1aa8f0-fb6c-4214-8121-e28883717cc4","resolution":{"observed_at":"2026-08-07T14:25:54.298722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:02.607197Z","title":null,"venue":null,"work_id":"ed18c321-623f-4c52-981d-6e500a4e07d6","year":2014},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.325371Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:936b4b7f496270a0761d8e9e1de463c6e5e4fee8abb28d8d22e68af003942e88","observation_id":"510f9c60-9be4-45fd-aa53-af17b0f65c59","resolution":{"observed_at":"2026-08-07T14:26:02.702185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:02.304803Z","title":null,"venue":null,"work_id":"1fad46b6-17cc-4feb-ae4f-6ce0f6f49bdb","year":2014},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.370149Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:2a4bda3f0f16e8c22d14fc1d726616335fedd475545ce96c777178fb61292d21","observation_id":"7bb10e6d-c9f9-4927-8207-92e511537aef","resolution":{"observed_at":"2026-08-07T14:26:02.447544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:02.028313Z","title":null,"venue":null,"work_id":"08729d95-de6d-48cb-b7fe-af228a81295b","year":2018},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.423431Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:6046ce4ddf6e44b070d4339839902617b9bfd5f6a586ca52a2f81dd972e22e5f","observation_id":"473c556d-5c5e-435c-92b4-74be9aa21ec8","resolution":{"observed_at":"2026-08-07T14:26:02.195716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:01.776158Z","title":null,"venue":null,"work_id":"a31a6f4e-b8e6-41c7-aad9-71ba01a6405b","year":2009},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.465184Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:45f4bdfbde3a399b6c9fc45ec2aa587992f07d7911731bd74d8fe3cb4664569b","observation_id":"24da164b-25da-4761-ba47-1a64075ea759","resolution":{"observed_at":"2026-08-07T14:26:01.874221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:01.481204Z","title":null,"venue":null,"work_id":"7a59931b-d6f3-43d1-925f-ed5277e6fd0b","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.491297Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:35d8b10e69a26a60783a57d147d0a4cb82dee79ed94a862f5e62723f32d52bc5","observation_id":"b8936649-867c-4878-a8f2-87ffe8c7787e","resolution":{"observed_at":"2026-08-07T14:26:01.628646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-07T14:25:54.587472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.587472Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7488698f1fda525b0b91ed313fcf7cd27572aa24dceddcd97384ed6f6ed13970","observation_id":"27933465-9277-4982-a242-568cca4b7967","resolution":{"observed_at":"2026-08-07T14:25:54.587472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07056","last_updated":"2024-01-13T12:09:49Z","snapshot_observed_at":"2026-07-06T17:15:10.548959Z","submitted_at":"2024-01-13T12:09:49Z","title":"Aquarium: A Comprehensive Framework for Exploring Predator-Prey Dynamics through Multi-Agent Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"2401.07056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07056","snapshot_observed_at":"2026-08-07T14:25:57.274126Z","title":"Aquarium: A Comprehensive Framework for Exploring Predator-Prey Dynamics through Multi-Agent Reinforcement Learning Algorithms","venue":"cs.AI","work_id":"38675ab7-9fe3-4f5a-9b33-f40c0bc4251d","year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.682011Z"},"links":{"cited_paper":"/paper/2401.07056","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:dfbd8bc61c91bff2f06a55e895e3e81470f7ca23b0102c1b1e3a651de265f584","observation_id":"772ed903-528e-47c5-88e2-123ce7e7f784","resolution":{"observed_at":"2026-08-07T14:25:57.380211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:01.194634Z","title":"I., Farajtabar, M., Li, A., Ghasemzadeh, H., & Saupe, D","venue":null,"work_id":"64f78386-98b9-407b-8682-bbb61c869472","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.709598Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:8b3325a6143155bac3cc21c6dc20e83d9e1662a10ab007fc1e0686aecfe82850","observation_id":"3284e3cd-8b45-497f-9ca3-f5a28bfcd801","resolution":{"observed_at":"2026-08-07T14:26:01.308384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.979960Z","title":null,"venue":null,"work_id":"b317ed1e-02c6-4651-9fec-e7d968fbb4a9","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.741486Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:b6205f5e27b639f6c99de40c64c57bd735dadeca135e7b207dd4f2a57ce1a21f","observation_id":"c379f565-2024-4d5c-8283-b3997f88299c","resolution":{"observed_at":"2026-08-07T14:26:01.100534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.864612Z","title":null,"venue":null,"work_id":"56d15657-0690-4b92-b1bd-fdec31110e24","year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.773044Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:41669573d3389e3814bb7edff24a27cce8d670e481a7b13f03f07ae8ee077bf7","observation_id":"92cc46db-3479-43b1-912e-35fc68e44134","resolution":{"observed_at":"2026-08-07T14:26:00.955376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.741582Z","title":null,"venue":null,"work_id":"1cace2af-d690-40d4-b45f-4fb3665a40d9","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.809222Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:c17529d263b4e9c2b250c2ba15bf47665445db5a5267550f7b5672ebaa1e2d46","observation_id":"e7cf84d4-ce30-488a-a60e-5073405202ce","resolution":{"observed_at":"2026-08-07T14:26:00.798250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.565308Z","title":null,"venue":null,"work_id":"da223fcd-b503-40bc-9070-589bdf393400","year":2015},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.873672Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:154f4f0417fc6c4f64f2be6c83d58367a3f9c1146717a9dd91a596a270a44a4d","observation_id":"18818753-9188-4a5b-814d-60688f1f14fd","resolution":{"observed_at":"2026-08-07T14:26:00.645022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.02441","last_updated":"2022-07-06T05:12:59Z","snapshot_observed_at":"2026-08-09T13:14:51.787594Z","submitted_at":"2022-07-06T05:12:59Z","title":"Inverse problems of inhomogeneous fracture toughness using phase-field models","version":1},"cited_work":{"arxiv_id":"2207.02441","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.02441","snapshot_observed_at":"2026-08-07T14:25:57.186672Z","title":"Inverse problems of inhomogeneous fracture toughness using phase-field models","venue":"math.AP","work_id":"fda3b222-12a3-4776-9d59-5f8fc2d1f549","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.964767Z"},"links":{"cited_paper":"/paper/2207.02441","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:65d866ec2bafb28605fb64a0070863ecddd40816daf48b3ac072097d5717d35e","observation_id":"fa0d8260-2ae5-4961-b396-9158165906aa","resolution":{"observed_at":"2026-08-07T14:25:57.213726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08793","last_updated":"2022-10-07T18:23:44Z","snapshot_observed_at":"2026-08-05T17:14:45.225349Z","submitted_at":"2021-12-16T11:22:30Z","title":"Fire retainment on Cayley graphs","version":2},"cited_work":{"arxiv_id":"2112.08793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.08793","snapshot_observed_at":"2026-08-07T14:25:57.064528Z","title":"Fire retainment on Cayley graphs","venue":"math.GR","work_id":"47c44c5d-11cd-49ed-ad0d-f4c453d369eb","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.009028Z"},"links":{"cited_paper":"/paper/2112.08793","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:10e7cc002931fd0ab1ce8773b47f944d04e94c7017de9987b1bf88c3505899a3","observation_id":"0f039e56-3c63-4c6c-8de0-54842830672f","resolution":{"observed_at":"2026-08-07T14:25:57.120676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00580","last_updated":"2023-03-01T15:23:13Z","snapshot_observed_at":"2026-07-06T14:57:24.801417Z","submitted_at":"2023-03-01T15:23:13Z","title":"The propagation game: on simulatability, correlation matrices, and probing security","version":1},"cited_work":{"arxiv_id":"2303.00580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.00580","snapshot_observed_at":"2026-08-07T14:25:56.929228Z","title":"The propagation game: on simulatability, correlation matrices, and probing security","venue":"cs.CR","work_id":"1409ed0d-537e-4988-a414-319945881812","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.046151Z"},"links":{"cited_paper":"/paper/2303.00580","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:435774dd9cbf158446a3ecd9425abb38f1b4421878e34fec8f6ff19126ecd437","observation_id":"369746f0-1255-4db0-93d5-9dd4e3437620","resolution":{"observed_at":"2026-08-07T14:25:57.017691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.399834Z","title":null,"venue":null,"work_id":"31d8a87b-6e24-49b4-a780-f710407e3c73","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.096875Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d046e01363fcf766e721ffc5025f847462d0f379e9c4f1fb741473fdbb5bebba","observation_id":"951e1b19-936d-473a-bdb9-cfa205f72b9c","resolution":{"observed_at":"2026-08-07T14:26:00.472396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:55.187622Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.187622Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:63fa5727e8af623bf3fcccfd8e2e8e6c3fc8a0a19a6f7f510486e4f0ff5c2009","observation_id":"fa746d19-9f32-4c77-9191-cdadcd3c32ae","resolution":{"observed_at":"2026-08-07T14:25:55.187622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02961","last_updated":"2019-10-07T18:00:02Z","snapshot_observed_at":"2026-07-06T08:27:30.833961Z","submitted_at":"2019-10-07T18:00:02Z","title":"Dirac neutrinos from Peccei-Quinn symmetry: a fresh look at the axion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02961","snapshot_observed_at":"2026-08-07T14:25:55.247256Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.247256Z"},"links":{"cited_paper":"/paper/1910.02961","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:242808b02d095009b0bf1face6f2c7b891a13c299f3f49f23ba773ab602a3ea2","observation_id":"796ca627-d06b-412b-af77-88b9b504e2dc","resolution":{"observed_at":"2026-08-07T14:25:55.247256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-07T14:25:55.276080Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.276080Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7b172374a33b35eee20fdc086fd50094e2821939706159b60cc69d95e6ec1115","observation_id":"c5ea83e8-85f5-4a42-b2c0-d95597919937","resolution":{"observed_at":"2026-08-07T14:25:55.276080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T14:25:55.317226Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.317226Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d239e8c94ecf0fc2f287beed8fa8d017587bc0db0d6411d3cb0ae57f77ec8b28","observation_id":"2649876b-31ca-43a2-8910-23f665024a1d","resolution":{"observed_at":"2026-08-07T14:25:55.317226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-07T14:25:55.385363Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.385363Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:45eb7b4ebdb50fe5f4799b6387655d6bf6b7a501113e61bb787a377c558306b1","observation_id":"1d6f4e5d-57fc-41b3-9b1f-fd9d40e586a1","resolution":{"observed_at":"2026-08-07T14:25:55.385363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10034","last_updated":"2025-03-28T16:47:25Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T22:34:15Z","title":"TULIP: Token-length Upgraded CLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10034","snapshot_observed_at":"2026-08-07T14:25:55.508904Z","title":"M., Asano, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.508904Z"},"links":{"cited_paper":"/paper/2410.10034","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:93774f23bf12e7639506d100508cb63800f23462a879b482b870c4dab7d83895","observation_id":"c024c5c0-6a4c-490e-b3b7-6111f159227b","resolution":{"observed_at":"2026-08-07T14:25:55.508904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.199445Z","title":null,"venue":null,"work_id":"0d327f06-30d7-471d-b398-6f400cb4a1f7","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.560581Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d0104d288475198722c119a2a440ea16f3d952ce2eab7e1330c8b2c8f900e9a3","observation_id":"8ca5ce2b-3039-483b-ad33-7bc84798c5c8","resolution":{"observed_at":"2026-08-07T14:26:00.305470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.112185Z","title":null,"venue":null,"work_id":"f238d0e3-aae7-4572-bfcc-e362eebbf4ac","year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.594642Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:76085cc5dbb40d72ba4fa16a625a21b84a9c95ac46619cc42f4bd005eb4bee23","observation_id":"a32bfb97-4d4d-48bb-840c-acb18ae9b3b4","resolution":{"observed_at":"2026-08-07T14:26:00.160018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.934246Z","title":null,"venue":null,"work_id":"5a427145-8cb7-43d2-9f42-22aeba019907","year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.641395Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:0601b9ec4648de4be62f7c2a524acd0f1ffa591f2c14f14a85d8ec65761b0e9c","observation_id":"c4a5c5ae-1e1f-4a70-88e7-da66cf146705","resolution":{"observed_at":"2026-08-07T14:25:59.976747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.827623Z","title":null,"venue":null,"work_id":"1026c707-70d4-4a1d-9120-4950fbeb2f5b","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.703274Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:80790af222795204c0bd48853ac6e53e4cda1ec9c00f950a78f65df7c4a0044d","observation_id":"0ad57ba7-e140-419b-8f3a-8d22bcb1b7be","resolution":{"observed_at":"2026-08-07T14:25:59.867491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.661854Z","title":null,"venue":null,"work_id":"7288082f-046a-4264-ae59-30adb24dda11","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.779961Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:5f16d0dd4fa39001b78e1e148f973c8c07eabd73984aaf7abe5f4b98f8553bd0","observation_id":"d5113bba-6c8e-42fe-b7b5-7126996b52a7","resolution":{"observed_at":"2026-08-07T14:25:59.743265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.591768Z","title":null,"venue":null,"work_id":"21a14741-1a8d-4b79-811e-f356978d2915","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.834318Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d2d0661c94b70d742187054c4231e5674cfe1dad85cf2aabbea908b2ee631b36","observation_id":"45b9e9f4-6aee-47f0-938b-84caf55dc84f","resolution":{"observed_at":"2026-08-07T14:25:59.617766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.462721Z","title":null,"venue":null,"work_id":"81397b3b-4e2e-444a-85e2-57248fb7c916","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.866715Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:ee4d37d7debf2bac49d9a12e8edf5e0a2cd7b68c041c67ba203b36c200627224","observation_id":"fd9be4a2-9753-407b-a8fe-397e1029d094","resolution":{"observed_at":"2026-08-07T14:25:59.556469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.259924Z","title":null,"venue":null,"work_id":"ea035152-02b2-4b49-a1ad-cec30b312a1f","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.907962Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:c926fb8717b55551d6dc5a1fa7f52ef21ff09413e4662cd8701a491aae76eedc","observation_id":"4f5f9f75-a98c-4737-b292-233addcaaeef","resolution":{"observed_at":"2026-08-07T14:25:59.364814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.072951Z","title":null,"venue":null,"work_id":"5d49b9ec-00b2-48ae-9d8f-f0073bbb4078","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.944257Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d9a52af072a4dbdd6beee7f2ba7b5e68142c9d5a39116d6ed1fd47f6c8428330","observation_id":"ed21fad7-5d91-4b3c-9417-3d209abfc1ed","resolution":{"observed_at":"2026-08-07T14:25:59.172501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.859149Z","title":null,"venue":null,"work_id":"b19c8466-0591-45a9-86cb-43f57e797c91","year":2017},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.036282Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:5653ce2e2fb303356fd479465333619d2f37fa5a9e651fbf41827028d8440308","observation_id":"ddebddf3-48a2-4d59-b788-4cdcee724851","resolution":{"observed_at":"2026-08-07T14:25:58.982712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T14:25:56.107134Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.107134Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:00086be57350c7bbb9f0abadd0364ae19c3f10e64617353c5d5e814e9be06d93","observation_id":"3809dd26-f25e-414e-8dcd-c805691c7f70","resolution":{"observed_at":"2026-08-07T14:25:56.107134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-08-07T14:25:56.146818Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.146818Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:41ba298ee2c439f79f1d68fc45c03fef416583331fbfe80944329eee3296150f","observation_id":"ec7984ff-0631-4bf1-9399-aca8e26b54e0","resolution":{"observed_at":"2026-08-07T14:25:56.146818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03928","last_updated":"2017-02-12T22:05:47Z","snapshot_observed_at":"2026-07-06T05:22:25.273447Z","submitted_at":"2016-12-12T21:15:57Z","title":"Paying More Attention to Attention: Improving the Performance of Convolutional Neural Networks via Attention Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03928","snapshot_observed_at":"2026-08-07T14:25:56.179594Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.179594Z"},"links":{"cited_paper":"/paper/1612.03928","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:2b1297cfe9700f23335b6e7f6b39dc38b858a8f797e3514416bb8624aa629e8c","observation_id":"a88c3f50-dfb1-4b88-a0eb-4f4e29fed2d6","resolution":{"observed_at":"2026-08-07T14:25:56.179594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.691671Z","title":null,"venue":null,"work_id":"1c2ba1e1-9f43-4e2b-be16-63b952fa929d","year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.230619Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d5d17b754265229b0b03a67ae504359dad31970d8c5793e53269f47505db179f","observation_id":"be991ec4-1862-4158-9155-5f680d255b89","resolution":{"observed_at":"2026-08-07T14:25:58.784385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09648","last_updated":"2022-09-08T15:28:57Z","snapshot_observed_at":"2026-08-10T04:59:05.636965Z","submitted_at":"2022-07-20T04:39:29Z","title":"Roadmap Towards Responsible AI in Crisis Resilience Management","version":2},"cited_work":{"arxiv_id":"2207.09648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.09648","snapshot_observed_at":"2026-08-07T14:25:56.775027Z","title":"Roadmap Towards Responsible AI in Crisis Resilience Management","venue":"cs.SI","work_id":"33706872-501d-4d4e-adef-28ab818d3f29","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.284928Z"},"links":{"cited_paper":"/paper/2207.09648","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7f86e35ae26c3ada361038534dbf76f8859fec5b93c28e06ade26eb8012b0246","observation_id":"d5140f29-4065-4f5f-9b2e-ed6c2893ec2e","resolution":{"observed_at":"2026-08-07T14:25:56.816008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.518137Z","title":null,"venue":null,"work_id":"632eed9c-6857-4cc6-91a7-b33fef7aba51","year":2018},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.318070Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:34e63e22f7607f3ec6a654ed5d69e52af7b2e39d0171ff274fbde214b91d9caa","observation_id":"ab60e996-028c-44cf-ab72-66aedd11b8fb","resolution":{"observed_at":"2026-08-07T14:25:58.613646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.324347Z","title":null,"venue":null,"work_id":"1ef10e19-412e-4375-8f6b-fa569c99605a","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.376642Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:34729753e52543e3913e46bb243640d13a1a7e57cec011398a7d3fcd73206c88","observation_id":"e35d8da2-388b-4c94-9764-addf6c1fd91e","resolution":{"observed_at":"2026-08-07T14:25:58.417932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.192585Z","title":"S., Wang, X., and Wang, J","venue":null,"work_id":"55f84b39-7977-4269-8889-52cdd2541b99","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.455900Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7f859f1df488f74aa8a3d16ae1c6cca04de5585151b7a230d4d10ecd4ef51e41","observation_id":"4edf188e-5c01-4c3f-8401-b777df827e2e","resolution":{"observed_at":"2026-08-07T14:25:58.268350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.002610Z","title":null,"venue":null,"work_id":"d419e429-d223-4630-a6bf-62adf5e07c96","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.537980Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:17c7a2c28f26cec3daa9abeb46bd915132c92ab552ebf4971cbbd5983c8f52fa","observation_id":"75bead6e-2c1d-445a-bc90-81bc1b16de70","resolution":{"observed_at":"2026-08-07T14:25:58.060358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:57.896593Z","title":null,"venue":null,"work_id":"caffb164-e555-4f4b-b99d-42e0d7e1fbe1","year":2015},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.596132Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:f55d5aa48d52f457d55142b89daf6a08595580bd11cc4597f933ac0810b2fdba","observation_id":"2d164aa9-795e-4bb7-b884-e307c41e87c4","resolution":{"observed_at":"2026-08-07T14:25:57.949014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T14:25:56.642103Z","title":"simple cosine distillation preservation loss between the student’s image embeddings and the original CLIP ViT-L model’s image embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.642103Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:48cb5fc4787bff24314632237a2bcfeefb559a4185be28015f0412fa78128582","observation_id":"23f211f9-cc7c-4d95-bfbd-cde7ba2ecff2","resolution":{"observed_at":"2026-08-07T14:25:56.642103Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":7,"verified_fuzzy":2},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 3 inbound Pith citation observations for arXiv:2505.21549."}