{"as_of":"2026-08-15T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e73019b7b624a40a55cb1b2f8f5a5af1e306f1b9fd9ac6ff70ab3a282dd9971f","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:00:36.548507Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.04011/citation-record","integrity":"/paper/1908.04011/integrity","json":"/paper/1908.04011/citation-record.json","paper":"/paper/1908.04011"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.426476Z","title":null,"venue":null,"work_id":"3851aeee-466a-4894-8c8a-9899a05f3687","year":null},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.343201Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:a4d41af41950b7ac05a75f47c25632ae189c6ec8e15b45ac5be03150abc0b727","observation_id":"7adc33be-3e3b-4a89-85be-f579451be386","resolution":{"observed_at":"2026-08-14T14:00:37.430708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07998","last_updated":"2018-03-14T05:24:23Z","snapshot_observed_at":"2026-08-14T20:45:26.011556Z","submitted_at":"2017-07-25T13:50:17Z","title":"Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07998","snapshot_observed_at":"2026-08-14T14:00:36.348714Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.348714Z"},"links":{"cited_paper":"/paper/1707.07998","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:de5818dc00ab0c88660198c382b4b7e660e0f0c5b2a356972114a1926889139f","observation_id":"bdcff372-10e6-49da-bba2-edaa64335f80","resolution":{"observed_at":"2026-08-14T14:00:36.348714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.413467Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"5e10370f-d114-42c6-8660-f9b4093aaef7","year":2015},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.353582Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:a6b000527d60a51647c8ef9069e883c205acab18b0c4820ac4c1648ef560364c","observation_id":"ce4f3ac8-69e8-4eaa-b45d-86bf6428ef96","resolution":{"observed_at":"2026-08-14T14:00:37.418021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.400220Z","title":null,"venue":null,"work_id":"06e12707-9805-43bc-9bd1-47a4dbafee34","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.357960Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:496eeb3d348fec5cfc9abd8e8a27c3ca569ce02ef624141b99d07dfada63384c","observation_id":"a716bd57-352a-4967-822c-2bb1800504a0","resolution":{"observed_at":"2026-08-14T14:00:37.404458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.386544Z","title":null,"venue":null,"work_id":"d0874a11-ece0-4cab-840a-f1acd103b4c7","year":2014},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.363265Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:cce5084a785184d8b4d72168830f3d1546dd14ded25ca18780701c17f7360111","observation_id":"7749af3e-cd42-4f17-a5d4-be0f7697324b","resolution":{"observed_at":"2026-08-14T14:00:37.391282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.373835Z","title":"Fleet, Jamie Kiros, and Sanja Fidler","venue":null,"work_id":"5a87a53a-238d-408f-a5b5-f8fbf939e9fb","year":2018},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.367829Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:6c6d7f30d6e5bf369a574940b076c186b3b12aac52abcf35faeee2558a57f3ac","observation_id":"df5fdf99-6b9d-4cfd-af1b-70b3c75ea003","resolution":{"observed_at":"2026-08-14T14:00:37.378210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.360417Z","title":null,"venue":null,"work_id":"32ad1ee7-02da-4ff6-a1e5-1f6e186ec52e","year":2016},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.372062Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:1cac392b4f51133a0f4002221339afd7f308cc903fca69f9c5649c01bcf09d65","observation_id":"ad7763d9-6dfe-4c12-8728-328a81d8790d","resolution":{"observed_at":"2026-08-14T14:00:37.365208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.347582Z","title":null,"venue":null,"work_id":"84b847e7-71ca-49ed-a5fe-12fd563530a2","year":null},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.376757Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:dc76f6c399aef72f7ea91dc9440075ca58687721192d48254e854a9866b2fde4","observation_id":"e7cc9e66-6d8b-49a8-bb82-5ecac5dd53e7","resolution":{"observed_at":"2026-08-14T14:00:37.351936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06420","last_updated":"2018-06-13T08:56:56Z","snapshot_observed_at":"2026-08-14T20:12:43.090559Z","submitted_at":"2017-11-17T06:10:03Z","title":"Look, Imagine and Match: Improving Textual-Visual Cross-Modal Retrieval with Generative Models","version":2},"cited_work":{"arxiv_id":"1711.06420","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.06420","snapshot_observed_at":"2026-08-14T14:00:36.916227Z","title":"Look, Imagine and Match: Improving Textual-Visual Cross-Modal Retrieval with Generative Models","venue":"cs.CV","work_id":"b2e9a56f-e47b-43bf-a376-134b31085355","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.384939Z"},"links":{"cited_paper":"/paper/1711.06420","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:93f94d906b92e7e3a1fcd977c17a63a8aba777ec3fc6ef9d3351dd9609a449ad","observation_id":"b7c8b03d-7681-4184-a569-e4bc29ee55e4","resolution":{"observed_at":"2026-08-14T14:00:36.920787Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.321629Z","title":null,"venue":null,"work_id":"a5ee1dc2-6e94-49f7-823e-0d3c0e9a2be1","year":2016},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.389641Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:72ff84a81f493f2dbe8ca0cbf0087c400ec6e99f6fe04881d03670d6fd2a9f37","observation_id":"af410105-7eea-444f-ab70-55f048c825de","resolution":{"observed_at":"2026-08-14T14:00:37.325575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.308545Z","title":null,"venue":null,"work_id":"f58cb448-5441-4e15-b37d-66c98a92ddb2","year":2006},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.393824Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:3d0909e383df7db5c1bdcb30b1112d224b57f52547038eda4858391ed90f3d2c","observation_id":"eaef7a39-853c-492e-8cc9-80691ea93e81","resolution":{"observed_at":"2026-08-14T14:00:37.312469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.296031Z","title":null,"venue":null,"work_id":"c907a605-0665-4568-8147-3e8e185d1081","year":2019},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.398431Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:8fc2e2e9f30ebba15dbd7c6d85f05be27c9f94cbcda73cd771a8d810e08862ce","observation_id":"30e376d4-3dbc-4ce4-bbe8-33ccb7e8385a","resolution":{"observed_at":"2026-08-14T14:00:37.300431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.281931Z","title":null,"venue":null,"work_id":"3966657e-d1c4-430c-a45a-60b769a111b5","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.402387Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:db989b9a53c0800cc00d7989b07e1e30452cb60d445a5a90ab6b6d4a54b8a1f3","observation_id":"f20563d3-11ea-413b-95c9-b23419cb5e77","resolution":{"observed_at":"2026-08-14T14:00:37.286162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02036","last_updated":"2017-12-06T04:36:40Z","snapshot_observed_at":"2026-08-14T20:06:27.116697Z","submitted_at":"2017-12-06T04:36:40Z","title":"Learning Semantic Concepts and Order for Image and Sentence Matching","version":1},"cited_work":{"arxiv_id":"1712.02036","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.02036","snapshot_observed_at":"2026-08-14T14:00:36.896397Z","title":"Learning Semantic Concepts and Order for Image and Sentence Matching","venue":"cs.CV","work_id":"bce67905-b367-4cb3-a03c-c1b9d8b7ed74","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.406651Z"},"links":{"cited_paper":"/paper/1712.02036","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:e94376791708e910a89fec57f4d71cae7028a037f71be7607cb1d04f04210b03","observation_id":"eca81666-87a5-495b-a684-21556a367d3f","resolution":{"observed_at":"2026-08-14T14:00:36.902232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.268766Z","title":null,"venue":null,"work_id":"01ce3a93-b9ba-4158-b947-5b186ab812c8","year":2016},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.411689Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:bbbd05dc4b58f75d851a203c2529811bd467bd201fcea7facf435e67034158ef","observation_id":"dbe7fd57-4a1c-4955-9c10-5b429ae080fc","resolution":{"observed_at":"2026-08-14T14:00:37.273144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.255397Z","title":"Karpathy and L","venue":null,"work_id":"27e4fe11-a9f2-4428-a3f3-3b7dd77674a2","year":2015},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.416527Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:cdcd71127b5ffa32360554b9b63ab4d63e467d0796addc86a96a5b56d64531ae","observation_id":"4a4f8dfa-8ba3-4105-b45d-97a6e70041b7","resolution":{"observed_at":"2026-08-14T14:00:37.259873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.04325","last_updated":"2017-03-26T16:22:47Z","snapshot_observed_at":"2026-08-14T21:35:17.971407Z","submitted_at":"2016-10-14T04:29:52Z","title":"Hadamard Product for Low-rank Bilinear Pooling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.04325","snapshot_observed_at":"2026-08-14T14:00:36.420524Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.420524Z"},"links":{"cited_paper":"/paper/1610.04325","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:42b1ebbe90471f1bd89afbc809649f26c0d1f405ab0663e47d696791a670b7ab","observation_id":"618efeb3-8b05-424e-8089-cd378f9f0cad","resolution":{"observed_at":"2026-08-14T14:00:36.420524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T14:00:36.425444Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.425444Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:24f816f4e9399f8f1a20473d06a48796fa8c9ec937c6497058b7a2aafd708e69","observation_id":"dffe9cf1-2f79-4e0f-be9f-cf58737347b0","resolution":{"observed_at":"2026-08-14T14:00:36.425444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.241174Z","title":"Zemel, Raquel Urtasun, Antonio Torralba, and Sanja Fidler","venue":null,"work_id":"9b077051-c465-4731-a295-51d96b992c85","year":2015},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.429836Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:7b55b4b7ba7858c218cc34f9eb206c8020f857159e1754904c6104f921e3438a","observation_id":"73efd469-26b0-4237-a2c2-f993f295fae8","resolution":{"observed_at":"2026-08-14T14:00:37.245573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-08-14T22:09:05.495219Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-14T14:00:36.434207Z","title":"Shamma, Michael S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.434207Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:4a92d567cfac782a0571bda29d34a2ba99dfed069c9be7fb3993036a1ed3fae9","observation_id":"b1888464-3036-4be2-9eda-711a0e6fde69","resolution":{"observed_at":"2026-08-14T14:00:36.434207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08024","last_updated":"2018-07-23T04:41:57Z","snapshot_observed_at":"2026-08-14T19:33:52.138713Z","submitted_at":"2018-03-21T17:22:27Z","title":"Stacked Cross Attention for Image-Text Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08024","snapshot_observed_at":"2026-08-14T14:00:36.438772Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.438772Z"},"links":{"cited_paper":"/paper/1803.08024","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:921accddf98e2ff982c51d1705269eaa285c256bc03a4ca05c162bebdc3d4d3f","observation_id":"26a75f0d-aa83-4c57-9166-834f0f16a916","resolution":{"observed_at":"2026-08-14T14:00:36.438772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.228636Z","title":null,"venue":null,"work_id":"cc631117-9d66-46ed-b9c4-b451a419f6a4","year":2015},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.443410Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:fe9b71ce53db54801020bb319b1e76e6770da497fa43f4dfa350988f241c0966","observation_id":"34658036-c996-49fc-a6c1-4ed649630eab","resolution":{"observed_at":"2026-08-14T14:00:37.232935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.214551Z","title":null,"venue":null,"work_id":"f4309ceb-4f4a-47f0-b1db-76df783c5b62","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.447581Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:2b2bc3ba9cb139fbda9932f78786c90f1ae7ec5ae504f8fbef8d8c33f53a650c","observation_id":"fec4b63e-c20f-4652-9673-35064186269a","resolution":{"observed_at":"2026-08-14T14:00:37.218823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.199725Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":"7199dec6-f756-4b52-9e6a-d1418ea6f897","year":2014},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.452285Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:67ea2d297403420a2b3f3d61cf65a4a66c03beaa2aba99546b7a223fe7533168","observation_id":"c7758c91-3776-4ddc-931c-c4be5120cf05","resolution":{"observed_at":"2026-08-14T14:00:37.204930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.185599Z","title":"Bakker, and Michael S","venue":null,"work_id":"ffe2851e-e4a0-497b-bb7f-56a9a44bb356","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.456860Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:92aedf8dfbffe21fd7aa66765e8eb8da0a3a6709c7f36095ac92513047ab7446","observation_id":"52ac635a-ff05-467e-8a68-80e1f641e445","resolution":{"observed_at":"2026-08-14T14:00:37.189730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.172011Z","title":null,"venue":null,"work_id":"991c4f8e-fb28-4dec-825b-a3edc026f57e","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.460781Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:37debb2dfef34fb465607a8cf3c0f2c440cdb064538cccf93a7dbe69e0e49cb8","observation_id":"8262b52c-3e4f-45e9-9739-5ae7c68bc1b1","resolution":{"observed_at":"2026-08-14T14:00:37.176336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.158231Z","title":null,"venue":null,"work_id":"48341a01-1f14-4778-9879-74bb72345046","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.464779Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:9cbf57bf9dcf8a2bb23fdec4fbaeff32de60608e59042995a083971bb5330d12","observation_id":"a67048cb-39a1-4edd-967e-836180cf293f","resolution":{"observed_at":"2026-08-14T14:00:37.162895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.143566Z","title":"Van Gool","venue":null,"work_id":"7eb7b856-b7f9-4dd0-8b0a-9c6eb758758b","year":2011},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.468827Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:f39fdfe90f844ca499527787f44bafad71d7366d8a5ad709bb5de709df3c3b32","observation_id":"bb3c997b-c383-45d5-b6d8-4f88a1c6c64f","resolution":{"observed_at":"2026-08-14T14:00:37.149216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.129392Z","title":"Girshick, and Jian Sun","venue":null,"work_id":"6a038b91-9bb1-44ad-b5ac-c1eff6c1bfe8","year":2015},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.472885Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:a176972504bf845a1ff9bfe211957d8b066e38d2fd592d853082d734dd557134","observation_id":"c7ad087c-7def-48d0-a44b-244e9064488e","resolution":{"observed_at":"2026-08-14T14:00:37.133870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.115570Z","title":null,"venue":null,"work_id":"f23d2a25-1298-4761-89cc-5a14d87f57c9","year":2012},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.477097Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:8d9d8faebe4e9d738bfc9cd1737fbcfbe3b56c9952d7bfe12d0fd83d4932eb18","observation_id":"3d5aa9cb-67fd-48d4-be6d-5a771a47a8ce","resolution":{"observed_at":"2026-08-14T14:00:37.119911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.102212Z","title":null,"venue":null,"work_id":"a5824461-8a7e-495e-867b-ce5286d1f919","year":2013},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.480962Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:2448c570b7a6d267f8ca3b2ebe4a2dd8f4a883cc31982bdfd341cde1c1c01a06","observation_id":"f9e84ff6-e057-4b4b-8acb-82b96dbd95ea","resolution":{"observed_at":"2026-08-14T14:00:37.106256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.089349Z","title":null,"venue":null,"work_id":"2171e58c-7821-4855-b823-5f1e2b50d778","year":2016},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.484689Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:82b59e8bf76b1611da069bcc0db0bc0f4836c32bc700531242113eae5a61f603","observation_id":"4bbe65a6-c95f-4e44-acb1-836c04401360","resolution":{"observed_at":"2026-08-14T14:00:37.093468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03470","last_updated":"2018-05-01T18:21:59Z","snapshot_observed_at":"2026-08-14T21:07:11.546080Z","submitted_at":"2017-04-11T18:00:25Z","title":"Learning Two-Branch Neural Networks for Image-Text Matching Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03470","snapshot_observed_at":"2026-08-14T14:00:36.488606Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.488606Z"},"links":{"cited_paper":"/paper/1704.03470","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:c817749a2fde8ea2270a6f55951839ad9c0e8d5e1ec19fdbcf5e07c82755df26","observation_id":"b8f98da2-44aa-444c-99c8-24ee300370f0","resolution":{"observed_at":"2026-08-14T14:00:36.488606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.076053Z","title":null,"venue":null,"work_id":"950481ed-aedd-4b1b-884a-2195b3fbaf0b","year":2018},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.492562Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:7b5cfe09b333877fb16a75cf90558ab751f0df5a4c21afc53959b7d7020b28bc","observation_id":"f2fbf4d1-535f-4fff-b2f3-d5518d342dc0","resolution":{"observed_at":"2026-08-14T14:00:37.080426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:36.496518Z","title":"Courville, Ruslan Salakhutdinov, Richard S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.496518Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:2458c35f5bbd0eb38db5172aac02e6d52e10a2ff20fd74f4b4d6ee1b2eac7ec3","observation_id":"b3552abc-4e41-4ca5-866c-fea3322266cf","resolution":{"observed_at":"2026-08-14T14:00:36.496518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11280-018-0541-x","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:36.577653Z","title":null,"venue":null,"work_id":"d7a06040-fa52-41c9-881c-9e0639339eee","year":2018},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.500522Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:d9eae1b6e09a3fecc61d042730dceaf4b235b7e9ffe857aff0ec55b92b97c81e","observation_id":"0119aa60-538c-48a8-8e2f-998c05f8fea3","resolution":{"observed_at":"2026-08-14T14:00:36.583522Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:36.504731Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.504731Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:378aecfba4382bb3e624044d9604c620ee19b2d8abfe5151daa19620be394ef5","observation_id":"2496a89d-8ff5-4b0e-9b7c-542f67d91cdd","resolution":{"observed_at":"2026-08-14T14:00:36.504731Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.054176Z","title":null,"venue":null,"work_id":"1309a20b-24c0-49f5-825b-0e82f4efadab","year":2010},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.508732Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:b7a9bd3ddd7c89e453e5be929a9d23e3a4962e681e95e8fede4597bbf61afb1e","observation_id":"236bb084-0047-4697-a89f-79ee4a952a80","resolution":{"observed_at":"2026-08-14T14:00:37.059083Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.040645Z","title":null,"venue":null,"work_id":"207fb7f7-a078-43a8-a41d-adb32ced0190","year":2012},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.512628Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:3133106677b299396ca9410bedb0bf1d0cef33a806fc2f1a4171c9745898ee0e","observation_id":"4bc25b92-441e-449e-82cd-9621302fbc85","resolution":{"observed_at":"2026-08-14T14:00:37.045270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.027586Z","title":null,"venue":null,"work_id":"5892f09d-2cf6-4ef2-a99f-b4157600b961","year":null},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.516575Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:a7bc65de28af2310b1ce0951a44de2bbea5e2bca7670c58887b19f5947bafcc2","observation_id":"ddc139aa-1d4c-48c4-b2b2-bde10d1c3f8b","resolution":{"observed_at":"2026-08-14T14:00:37.031940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:36.997728Z","title":null,"venue":null,"work_id":"e3b7996a-63a0-4f5d-be8d-ca6865af468d","year":2016},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.524442Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:e746d35b35460fe7310346d2b0416a289d2989993ea3b9f3d1efbe0085eebd83","observation_id":"521546f6-91f2-4501-a556-74f07d82279a","resolution":{"observed_at":"2026-08-14T14:00:37.002342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.013171Z","title":"In International Conference on Multimedia Modeling","venue":null,"work_id":"b981962b-556e-4de0-ac38-0e5961d4a58d","year":null},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.520492Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:9931750705926a71031cd8110b4239660e4bc2f5daf352d5fd40c8f3ed414dbd","observation_id":"93a20cb7-16bf-4011-9133-5e58293560ae","resolution":{"observed_at":"2026-08-14T14:00:37.018034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:36.969333Z","title":null,"venue":null,"work_id":"35a04ace-872d-4563-9acd-002e5e99c00d","year":2018},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.532634Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:f43f22bbd0e5b0d55b3b9c0b4e800b95cfc28ac34a8a35d8af9d4041fd252c64","observation_id":"7fb0b3b8-4f8d-4651-a873-48fe42934c28","resolution":{"observed_at":"2026-08-14T14:00:36.973956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:36.983907Z","title":null,"venue":null,"work_id":"48202259-5b1a-45aa-85c7-bb73817473b1","year":2014},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.528423Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:05fa502286c6862156e553c0d447155ce341f8eca5d7cfd1c9e82966fbda7503","observation_id":"93757701-b5da-4234-8eb4-0a3cdc389868","resolution":{"observed_at":"2026-08-14T14:00:36.988119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:36.956043Z","title":null,"venue":null,"work_id":"833b9826-e0d4-4070-a78b-32e001be16af","year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.540724Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:ae3fefc8f6f48f5e9ff324c9c34221cd79353679fb9cd5bd5bb877a5e9b2057e","observation_id":"767e1c01-73d0-4763-8eeb-c3b6dd94a79c","resolution":{"observed_at":"2026-08-14T14:00:36.960329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05535","last_updated":"2021-07-27T07:45:26Z","snapshot_observed_at":"2026-08-14T20:13:29.131358Z","submitted_at":"2017-11-15T12:40:11Z","title":"Dual-Path Convolutional Image-Text Embeddings with Instance Loss","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05535","snapshot_observed_at":"2026-08-14T14:00:36.536698Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.536698Z"},"links":{"cited_paper":"/paper/1711.05535","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:65d3632791f3248a500e8b034e7b0c26760df79d2f7a27331153ebad2cd5306c","observation_id":"d2daa421-2d1e-4871-a57f-8ab8ea170487","resolution":{"observed_at":"2026-08-14T14:00:36.536698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:36.942925Z","title":null,"venue":null,"work_id":"d3fe0df9-c340-484b-98a8-50ac1bbf9b8f","year":null},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.544599Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:b135c139e5428c92b8b6b111c776545ad053d05e0d5d7ce7dda99da3d0c17b08","observation_id":"8a91366a-e657-4051-a25f-26bbe14eeef6","resolution":{"observed_at":"2026-08-14T14:00:36.947204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02167","last_updated":"2015-12-15T05:17:49Z","snapshot_observed_at":"2026-08-14T22:19:39.710069Z","submitted_at":"2015-12-07T19:00:54Z","title":"Simple Baseline for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02167","snapshot_observed_at":"2026-08-14T14:00:36.548507Z","title":"CoRR abs/1512.02167 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.548507Z"},"links":{"cited_paper":"/paper/1512.02167","citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:1f9e276532b60aa1e43c63993d4e546ec2d61b2a0b3b62a718f6503b6451dabb","observation_id":"f6cea676-2520-44d4-a480-d9222ef563a7","resolution":{"observed_at":"2026-08-14T14:00:36.548507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:00:37.334370Z","title":"In 2015 IEEE International Conference on Computer Vision","venue":null,"work_id":"32117c97-fe65-46c5-992f-7e9f6343c0b9","year":2015},"citing_paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T14:00:36.380983Z"},"links":{"citing_paper":"/paper/1908.04011"},"observation_digest":"sha256:e72b04201802790345361a2761bf254972ece4dd7b15ab7fcbec98eb86b705d7","observation_id":"59d5dccb-0073-41e0-b9d0-99e18bc73036","resolution":{"observed_at":"2026-08-14T14:00:37.338747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.04011","last_updated":"2020-07-29T14:11:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T14:28:40.343805Z","submitted_at":"2019-08-12T05:52:44Z","title":"Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:1908.04011."}