{"as_of":"2026-08-13T03:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64ca686a08fe59c922863fffb340bd087dbdb412ad4f7a66d2d8fb184c7e02d9","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:19:58.847247Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08590/citation-record","integrity":"/paper/2507.08590/integrity","json":"/paper/2507.08590/citation-record.json","paper":"/paper/2507.08590"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.433776Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":"28745ed4-f4cf-4e1c-9ab1-c125edbf1be1","year":2015},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.647447Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:76deeb863ce5e75d73ce559a2bca4848746ad34740e8093d684ab150f5c9e64f","observation_id":"e4cc6cc2-5ebc-46f6-9f6f-bdcaf9a95f63","resolution":{"observed_at":"2026-08-06T18:19:59.439282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.410754Z","title":"Stacked cross attention for image-text matching,","venue":null,"work_id":"bb4b6ea7-4f95-4269-9387-994e539d957f","year":2018},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.652953Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:ebe6ff2bf0c7a9b6ebdf11855d5728355162694db01e5a8d3727031f8a27adb6","observation_id":"820545a0-8f94-4934-b661-03f81fcd31c3","resolution":{"observed_at":"2026-08-06T18:19:59.421214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.382313Z","title":"Image- text embedding learning via visual and textual semantic reasoning,","venue":null,"work_id":"92dcd00e-2e90-4c23-8c04-a8a238404805","year":2022},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.657786Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:ce6a54786d977894591df40fa4661bb4d977890935d1e027f944b5508b33f2e6","observation_id":"cdfd30ec-1d79-4a7c-be7b-f4ca4a409cfe","resolution":{"observed_at":"2026-08-06T18:19:59.397910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.362226Z","title":"At- tentive mask clip,","venue":null,"work_id":"807c0792-22b8-428f-b4e9-85a9cb1a66f6","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.663498Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:ae33830c77b7af968077a1b977acecabe45551a0c89d1f79b5a24b6921a436ee","observation_id":"514a9348-726f-42c5-b9a6-7cd810702ce2","resolution":{"observed_at":"2026-08-06T18:19:59.367248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.347717Z","title":"Composing object relations and attributes for image-text matching,","venue":null,"work_id":"3fe69b7f-6a0f-4062-b9d2-490707123b81","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.669323Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:d2806cd4a6da8cc98f2d2982f5a4a54473081109014f11cecf4f8251c6b5d403","observation_id":"c5fe10b2-5c13-4113-89f0-2502927467bb","resolution":{"observed_at":"2026-08-06T18:19:59.352015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.331053Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"3e17597a-5371-4c1c-84cc-23e5e6f23704","year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.675803Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:4af8c7cbd091ffd9a19477db9ec5e2cbb58e4f79d0129948211e0f58d385f10c","observation_id":"8d94c9a9-67e6-475f-adf3-a00f85950f4e","resolution":{"observed_at":"2026-08-06T18:19:59.336427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.313403Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"25ad00aa-0a05-400c-9143-3dfb04e8625f","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.683871Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:3bc3a72b846b484d3f3530eb57257bfd66a1f7cceb128f6c715a8ecf8d08119d","observation_id":"8ca9b18e-f722-4b92-b8a7-a6d85806f3d2","resolution":{"observed_at":"2026-08-06T18:19:59.319859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.284633Z","title":"Regionclip: Region-based language-image pretraining,","venue":null,"work_id":"e77bedf5-3147-4b29-94ae-ecfc6bcffa69","year":2022},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.693360Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:d5f88d5a9ea14565117c93d0fd4807186558806d05e5fed48008cb076a12e716","observation_id":"2f68182e-5c82-4a45-bea4-6ba588a05ed2","resolution":{"observed_at":"2026-08-06T18:19:59.292337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.262277Z","title":"Sclip: Rethinking self-attention for dense vision-language inference,","venue":null,"work_id":"fb10f4e2-71f9-40ac-bfba-1a02208d0e15","year":2025},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.703590Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:56c5bc6ad8c087496e48488ed160d86d90e9e79f9c666b32bce5efbbda4b9f3a","observation_id":"30654223-7950-4359-9836-f79e4b7a9526","resolution":{"observed_at":"2026-08-06T18:19:59.267034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.244975Z","title":"Improving clip training with language rewrites,","venue":null,"work_id":"0f66b826-6ea5-4e72-9191-2a36aadd4098","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.715883Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:50acde7cdf0943ca1a3b62bdc1515ed10642daefe7a3c7f1d3d9e0aa33799b20","observation_id":"9bccf390-e917-45ae-b837-fc8e5ac865aa","resolution":{"observed_at":"2026-08-06T18:19:59.250030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.228752Z","title":"Improving multimodal datasets with image captioning,","venue":null,"work_id":"991cc153-beaf-4a00-b419-71e57665fd6c","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.728908Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:70e736c1ebc91e93218214931fba26b66d57ee776ff067336ce8ad771aff5313","observation_id":"f1acdda5-029f-4367-ad21-f8a58209a01a","resolution":{"observed_at":"2026-08-06T18:19:59.234196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.212701Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"9126f724-64d0-46c1-a87b-68e9d146ae37","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.735122Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:95999a1fedcd90bc46d6ca015e15f4eb17a8a73461dd6e3a4e24a4f6d9089bfc","observation_id":"cbb654d8-1fa7-4e50-b034-6b2ba87c5c8a","resolution":{"observed_at":"2026-08-06T18:19:59.218150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18765","last_updated":"2024-03-13T08:47:32Z","snapshot_observed_at":"2026-08-12T23:27:27.865170Z","submitted_at":"2023-11-30T18:05:52Z","title":"MLLMs-Augmented Visual-Language Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18765","snapshot_observed_at":"2026-08-06T18:19:58.740424Z","title":"Mllms-augmented visual- language representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.740424Z"},"links":{"cited_paper":"/paper/2311.18765","citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:b6e7376ee21a236bc91d9ba5863d73650b6f9b5a189dc74824a7914bc0c6ae41","observation_id":"0ee958d2-bfaf-42c2-be02-df1ebbc15013","resolution":{"observed_at":"2026-08-06T18:19:58.740424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T18:19:58.748432Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.748432Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:d8de2759e6c0ba51285918f8cb2cd63bb4347b7c0cf7f204a6e343e122b38be9","observation_id":"6af04eb6-4472-4714-bb0f-7cc3062c3059","resolution":{"observed_at":"2026-08-06T18:19:58.748432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07597","last_updated":"2024-09-24T03:01:25Z","snapshot_observed_at":"2026-08-09T21:52:29.568774Z","submitted_at":"2023-09-14T10:57:50Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07597","snapshot_observed_at":"2026-08-06T18:19:58.753670Z","title":"C- pack: Packaged resources to advance general chinese embedding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.753670Z"},"links":{"cited_paper":"/paper/2309.07597","citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:c78ebd460960f554fe5c9e817196f65d637dcba18ce4876f4195bf02643dfad4","observation_id":"0033427b-733e-4acb-b098-13d0f736b924","resolution":{"observed_at":"2026-08-06T18:19:58.753670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.195693Z","title":"Fine-grained image- text matching by cross-modal hard aligning network,","venue":null,"work_id":"8d11b55d-89f8-461a-ae94-5b09f00e4ce6","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.761302Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:2591d68892a442cf6cf6cc7171f2c2652ee075df2a213fdc84df61b94d09c2fe","observation_id":"08f96dca-8f4c-404a-be87-e9c1a9a24f75","resolution":{"observed_at":"2026-08-06T18:19:59.201309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.177215Z","title":"Fast, accurate, and lightweight memory-enhanced embedding learning framework for image-text retrieval,","venue":null,"work_id":"e8a6cda6-71d3-4b9d-a946-3c590d9776cc","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.768032Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:704d27bceec9aa4fc8ddd6579451f711e05b35fec2b9998a244471fe71cd74bb","observation_id":"50e81f65-4615-40ad-b95f-ed89de7a1fc4","resolution":{"observed_at":"2026-08-06T18:19:59.183805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.159870Z","title":"Learning the best pooling strategy for visual semantic embedding,","venue":null,"work_id":"a5681e76-26d5-43ea-af3d-25ecc79b80a5","year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.772689Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:5fd5666acf756ebb3d12d6d7a3c59bc3ae7e64b9efd51d0432212492668003e0","observation_id":"fcd0442a-4ab7-452f-a98d-8230c52abf65","resolution":{"observed_at":"2026-08-06T18:19:59.166182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.138925Z","title":"Learning semantic relationship among instances for image-text matching,","venue":null,"work_id":"02f829d3-036d-4a87-8508-ba6ea02e0779","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.777092Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:cfbf0df66421bee9bcdc3be4d7a15fde3e2db725d5e56fccf77575b51e74ea7b","observation_id":"e001793f-3add-4bdf-9b6a-1e4239ba249c","resolution":{"observed_at":"2026-08-06T18:19:59.145425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.118544Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport,","venue":null,"work_id":"b9bdf4e1-6a60-4538-bf0e-676ee2d067e5","year":2013},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.797389Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:bcaafc6a198dda47d7c491fb414aa74fb118c5ce0619cc8456a6358e6ac39231","observation_id":"26a67493-2443-427f-b1e0-30aa4136f551","resolution":{"observed_at":"2026-08-06T18:19:59.124932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.099962Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":"bbaf3ec5-5829-49ed-a226-a71f017949d9","year":2015},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.805931Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:c8a63d895b08357bb7d4c9e011c5c5cc386baad6aee7d8dd8511377ff12126c6","observation_id":"f2d0d17a-2ff4-4404-9b24-cbaf2c7c7a03","resolution":{"observed_at":"2026-08-06T18:19:59.105418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13327","last_updated":"2022-06-06T06:51:28Z","snapshot_observed_at":"2026-08-09T20:09:32.684285Z","submitted_at":"2021-08-30T15:46:09Z","title":"N24News: A New Dataset for Multimodal News Classification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13327","snapshot_observed_at":"2026-08-06T18:19:58.811615Z","title":"N24news: A new dataset for multimodal news classification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.811615Z"},"links":{"cited_paper":"/paper/2108.13327","citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:0ae2c9d92da4af45e4520985894d5b366e7d9379b0112250ccdea7c6a959a8dd","observation_id":"593e71a4-bd87-4236-a740-ca1389172458","resolution":{"observed_at":"2026-08-06T18:19:58.811615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.079035Z","title":"Exploring a fine-grained multiscale method for cross-modal remote sensing image retrieval,","venue":null,"work_id":"75dbe651-37b5-4bc3-b4a8-20453dbd6c6a","year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.817342Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:1ebbb1142b0f32847f306d450814305159e8bf7f87c98f764aca2f14f662efbc","observation_id":"e83deb29-8974-4017-8f07-bfd8cee1eefa","resolution":{"observed_at":"2026-08-06T18:19:59.084295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.058998Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks,","venue":null,"work_id":"c6776c59-49d6-40fa-a8f9-767391c38caa","year":2024},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.825844Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:bb9a3f12fffa68dcfc17ede75f57e6255990c2356fb3d3c714a7a3dada24c5ff","observation_id":"b76fc5ee-b355-4008-8d7e-2ea5b2803cc3","resolution":{"observed_at":"2026-08-06T18:19:59.065552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.036951Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":"f3bef786-bb64-4ee9-9897-b44513ab2585","year":2021},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.832266Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:93471f0cafd42910a190250eebecfc78455ec6973f24dfb30a59778fdbb2fc09","observation_id":"337190bb-dc06-4ccb-9f17-3e968b6363a9","resolution":{"observed_at":"2026-08-06T18:19:59.045119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:59.014268Z","title":"Remote sensing cross-modal text-image retrieval based on global and local information,","venue":null,"work_id":"8bcf3144-9876-435b-ae4f-e86c53ab2edb","year":2022},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.842725Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:c8a88222257d32ffa2e07f030da25b935c842884ca84120fb1a15b25a61a93f1","observation_id":"8ab328d0-2d7d-4a6b-bbe6-4b9ed6e2c7ca","resolution":{"observed_at":"2026-08-06T18:19:59.019781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.993729Z","title":"Hypersphere-based remote sensing cross-modal text-image retrieval via curriculum learning,","venue":null,"work_id":"94a85b19-386e-4be0-86ec-1931911e7000","year":2023},"citing_paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.847247Z"},"links":{"citing_paper":"/paper/2507.08590"},"observation_digest":"sha256:180ac7e630ae643e8a5ec45e79f024e770b42a00f1e27ed8491edbaa7a3530a9","observation_id":"5d951393-c6d2-46c2-b4a3-189abee9d957","resolution":{"observed_at":"2026-08-06T18:19:59.000703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08590","last_updated":"2025-07-11T13:38:01Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-08T20:24:15.902861Z","submitted_at":"2025-07-11T13:38:01Z","title":"Visual Semantic Description Generation with MLLMs for Image-Text Matching"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2507.08590."}