{"as_of":"2026-08-14T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c713c714dd19217b861f459ab30519edefe787220a65b0825b059fadfd6bbc67","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T03:11:37.361024Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.07756/citation-record","integrity":"/paper/2605.07756/integrity","json":"/paper/2605.07756/citation-record.json","paper":"/paper/2605.07756"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:36:10.633869Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"1bdc18bb-17d9-44c5-8f2b-ca096572a66b","year":2019},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:ec84de37912394ec0ba2f8614d6827a36f92984193c6a9a6db0124d2ff6c9933","observation_id":"d552e6eb-9a94-42b1-b84b-9fb6655d1583","resolution":{"observed_at":"2026-05-14T10:54:13.607229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bootstrap your own latent-a new approach to self-supervised learning.Advances in neural information processing systems, 33:21271–21284","venue":null,"work_id":"ee05c510-aa60-4384-8960-61327433f4dd","year":2020},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:1c68eb6d9e5f16f9ee07db34efbf9f567e0d4f01163d07303ab73696fdf07d28","observation_id":"cf5a6a5c-7fdd-49bf-bf04-257108310200","resolution":{"observed_at":"2026-05-14T10:54:13.614672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coles: Contrastive learning for event sequences with self-supervision","venue":null,"work_id":"6f5741c8-6a2b-48d2-a7dd-e3d52803b0ad","year":2022},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:5e288b8b5b6e7a36db35badfa90862ef627c162a42875ad213dd1cbaa42f1945","observation_id":"56ccf934-d434-4b2b-88ee-c0c6126b5af4","resolution":{"observed_at":"2026-05-14T10:54:13.603500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tabular transformers for modeling multivariate time series","venue":null,"work_id":"dcd9adce-5763-4df1-b726-968f33f9493e","year":2021},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:6390c35f769efb15af42d819219a5548f24e28017cda2b520a19e0dd2b092085","observation_id":"4254882a-b524-4a39-a91c-b1e8a1173e36","resolution":{"observed_at":"2026-05-14T10:54:13.612967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All4one: Symbiotic neighbour contrastive learning via self-attention and redundancy reduction","venue":null,"work_id":"b0edd70c-ed30-45f1-a35e-543e6a719795","year":2023},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:d07b2619c30cc74b61f02242b488673b0d6bdb43a50ffec24e8f58bace91cdc4","observation_id":"c78efa33-0afd-46d8-aa2c-96287fbbcef3","resolution":{"observed_at":"2026-05-14T10:54:13.609763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01474","last_updated":"2025-08-02T19:50:58Z","snapshot_observed_at":"2026-08-13T10:23:46.209045Z","submitted_at":"2025-08-02T19:50:58Z","title":"HT-Transformer: Event Sequences Classification by Accumulating Prefix Information with History Tokens","version":1},"cited_work":{"arxiv_id":"2508.01474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01474","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ht-transformer: Event sequences classification by accumulating prefix information with history tokens","venue":null,"work_id":"34f05052-78af-40f9-90e7-b1b9c5d406a8","year":2025},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"cited_paper":"/paper/2508.01474","citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:422f3e01de4798ad4c3849313013c4f29a9a901e446e1dfbadfcaee53b87d072","observation_id":"ddfc6634-046a-4e89-9be8-2b27a5f58115","resolution":{"observed_at":"2026-05-11T03:15:54.998290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/068431-2059","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Practical bayesian optimization of machine learning algorithms.Advances in neural information processing systems, 25","venue":"Advances in Neural Information Processing Systems 35","work_id":"782af98e-2ce3-4e2d-a6ca-c516779c8487","year":2012},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:4635f819d1b9a6332d1eae50403a4556c964764627996edf1e1ecc199c8bd5e6","observation_id":"467cc0b5-f444-4439-9f6b-f8bb1f054f87","resolution":{"observed_at":"2026-05-14T10:54:13.605170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:31:35.834090Z","title":"Gradient surgery for multi-task learning.Advances in neural information processing systems, 33:5824–5836","venue":null,"work_id":"434b00a8-8728-4732-9152-f97190959c14","year":2020},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:22603bbb1cd9e41d184890dd2ac21285a624356193a0c7161e544a16c36d4baa","observation_id":"30497b99-bf06-4e7a-a238-7eddab3750d4","resolution":{"observed_at":"2026-05-14T10:54:13.616419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bilevel programming for hyperparameter optimization and meta-learning","venue":null,"work_id":"20fb0050-c9e4-4e90-915e-3d717ebdf2e6","year":2018},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:5db85662f96e7936dcd405359204a4d0c70a831565fd386db015dde12a7d1cf1","observation_id":"207251bf-82e1-45e7-9586-dbb3a5bb343d","resolution":{"observed_at":"2026-05-14T10:54:13.611401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-task learning as multi-objective optimization.Advances in neural information processing systems, 31","venue":null,"work_id":"e3e6d18c-8992-4144-beac-c713cad1bd1b","year":2018},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:c5ccea7e5c9725436c8524553ddc688ee04763f7b325e3a0d995aadd84797e3c","observation_id":"a3643a71-072c-407a-a83d-4df08ecedf41","resolution":{"observed_at":"2026-05-14T10:54:13.566750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truncated back- propagation for bilevel optimization","venue":null,"work_id":"5be653fc-dcbd-41b6-bb77-e45c7eee5069","year":2019},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:3e8df9f10b237c9ac1232d39690cf73c9546c76bbb3a73e55ed36adf6a349b33","observation_id":"2fd20c1d-17dd-4109-8d68-93342163071b","resolution":{"observed_at":"2026-05-14T10:54:13.568587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":"be47fb32-4af4-47d2-9d2b-59145620e4ac","year":2018},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:ada45ee10390abfc103d04e209543b5c90e0d365b0821ca0f99f3447befe33fe","observation_id":"00e0887f-1d2d-42ad-a688-a9c44e1c2d50","resolution":{"observed_at":"2026-05-14T10:54:13.570401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Independent component alignment for multi-task learning","venue":null,"work_id":"caadffe9-5680-4080-9111-8e8e2d96c1cf","year":2023},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:e47bc3ddf510b32d09559b6d9d41fb39ac1b8f811cc5fea97f10f257356fa743","observation_id":"63299872-af95-4716-b5af-521f26472cd4","resolution":{"observed_at":"2026-05-14T10:54:13.572112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end multi-task learning with attention","venue":null,"work_id":"15252eb8-9b5d-452b-acb7-1bd489ba8b28","year":2019},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:dfdbb333ab8cae8d3e10f6a0d7e2694df31eb038815006c0fa5e9e7da1ab5463","observation_id":"cdadf241-a899-40d6-85e2-43efce0d9fbf","resolution":{"observed_at":"2026-05-14T10:54:13.573832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-task learning using uncertainty to weigh losses for scene geometry and semantics","venue":null,"work_id":"0cd17fdd-5ac8-4de2-afe8-4c645a280a38","year":2018},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:a29844e76e70302ca78363f0693b7cdf011e883e338d4bcf65ee7af08db77af3","observation_id":"f04a78a6-887e-4b4b-9049-f71460c693d4","resolution":{"observed_at":"2026-05-14T10:54:13.591220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pytorch-lifestream: Learning embeddings on discrete event sequences","venue":null,"work_id":"1ad5876a-1a56-4842-8df1-d34e17152a9a","year":2025},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:93aba5eaae547483d37d2ed6a561935215296ed950e7d573999ab12c65e33d29","observation_id":"bf9d8ccf-064a-4c70-a701-9d266f4c8893","resolution":{"observed_at":"2026-05-14T10:54:13.592840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optuna: A next-generation hyperparameter optimization framework","venue":null,"work_id":"de16b675-aac9-4da1-a322-e14fe3eb7b2d","year":2019},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:00aecb8e257db5ec2e6fa2378e4043260130467b2dd658072bbd8c005e13b59f","observation_id":"20f35488-f6f4-4a60-97f3-1eb849ff8ca1","resolution":{"observed_at":"2026-05-14T10:54:13.594670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:44:26.958146Z","title":"solo- learn: A library of self-supervised methods for visual representation learning.Journal of Machine Learning Research, 23(56):1–6","venue":null,"work_id":"306951d0-e74d-41f3-b518-4a213254e3ad","year":2022},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:7ef2dbcea0933bbfa1d0e556ec88de9dc41f065e7b68e01affbcfbab1e1f2c3f","observation_id":"9d3938a6-60df-4553-a6bc-71001d17775f","resolution":{"observed_at":"2026-05-14T10:54:13.596380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7717/peerjcs.633/fig-5","metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:47:03.723149Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"3807822d-12bd-4f6f-89ab-c3132c0cbfff","year":2009},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:54ccdbdc1a7f96b6cfeeba79fd6a34e574291b0e705e397b388beffb9030235f","observation_id":"f7f7cd3c-e0ea-4bfb-9317-58efbe75ca74","resolution":{"observed_at":"2026-05-14T10:54:13.601881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:13:35.391292Z","title":"Imagenet classification with deep convolutional neural networks.Advances in neural information processing systems, 25","venue":null,"work_id":"0c20789b-b203-4c32-9b59-975271118e41","year":2012},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:6f49104dfba76a7ed2e94590c5103987c126e7dbd2637c3b55a81229950b61de","observation_id":"c07e6367-aca1-4246-ade4-6de145498799","resolution":{"observed_at":"2026-05-14T10:54:13.598173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:44:26.956021Z","title":"Barlow twins: Self- supervised learning via redundancy reduction","venue":null,"work_id":"70153638-3b9b-46ec-b9bd-3eb4dd42d57f","year":2021},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:aba9569a5be642692829b5cc83813363025320ccb50995884415e35841b8be81","observation_id":"07e9d31c-9f34-4855-a3db-b4b551199231","resolution":{"observed_at":"2026-05-14T10:54:13.575742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"With a little help from my friends: Nearest-neighbor contrastive learning of visual represen- tations","venue":null,"work_id":"e1063810-c4cb-4480-a0c2-872618a947be","year":2021},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:b9850ba29cfff885a8c7f2d4ab0b9a77541edcb6aa5806b0cbb477be9c58752b","observation_id":"868ec518-b03a-4875-ad7b-d8637428dfba","resolution":{"observed_at":"2026-05-14T10:54:13.577408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making a science of model search: Hyper- parameter optimization in hundreds of dimensions for vision architectures","venue":null,"work_id":"c5fef8d4-3832-4650-993b-df55557f8a41","year":2013},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:472c89d124d2616de566059ad29058d71820cccb59c14170727ce2fa95df9897","observation_id":"cb27ac88-cc26-4963-b27c-645d9ddec4c3","resolution":{"observed_at":"2026-05-14T10:54:13.599951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2bdeae41-33e1-4b5e-b930-163836a2cd13","year":2015},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:868b12bbf294e0bab38b15e710dd2963c4c503adb3f9f63f4f53eee79c5b486c","observation_id":"02b22c3e-f36c-4f72-a4b2-b5f94d8b47af","resolution":{"observed_at":"2026-05-14T10:54:13.589540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.00917","last_updated":"2016-04-06T15:55:19Z","snapshot_observed_at":"2026-08-14T22:15:52.798869Z","submitted_at":"2016-01-05T17:43:15Z","title":"DrMAD: Distilling Reverse-Mode Automatic Differentiation for Optimizing Hyperparameters of Deep Neural Networks","version":5},"cited_work":{"arxiv_id":"1601.00917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1601.00917","snapshot_observed_at":"2026-07-04T20:56:49.839258Z","title":"Drmad: Distilling reverse-mode automatic differentiation for optimizing hyperparameters of deep neural networks","venue":null,"work_id":"4a1efff6-4cef-4705-8864-5caf2ab06520","year":2016},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"cited_paper":"/paper/1601.00917","citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:4f7c898565e0e04e42ea51776bbffd57507e43285b0cbeadbe80c92d012307c0","observation_id":"ad269814-27ac-4ed8-bdfd-65802e223286","resolution":{"observed_at":"2026-07-04T20:56:49.839258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable gradient-based tuning of continuous regularization hyperparameters","venue":null,"work_id":"5f9ecf4f-14e8-4836-a2f3-5ef07fa244e3","year":2016},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:41fe08f3e47224e6ca891538913651f577dd43c18c1f184edcc7d1bd763aa8a4","observation_id":"dbbff8e9-48df-47f8-97ee-d748351907ba","resolution":{"observed_at":"2026-05-14T10:54:13.582617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimizing millions of hyperparameters by implicit differentiation","venue":null,"work_id":"7b23354b-f237-44ed-bd75-fa51091440e5","year":2020},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:9120b89cc6b670ffad2441d54c311174ff17d6415c0ad2d95bf96348e0881271","observation_id":"b55e35eb-3421-4bac-ac50-901688a1d78f","resolution":{"observed_at":"2026-05-14T10:54:13.584169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16232","last_updated":"2025-02-03T12:29:44Z","snapshot_observed_at":"2026-08-13T06:12:13.263235Z","submitted_at":"2024-06-23T22:06:25Z","title":"Jacobian Descent for Multi-Objective Optimization","version":3},"cited_work":{"arxiv_id":"2406.16232","doi":"10.48550/arxiv.2406.16232","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16232","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jacobian descent for multi-objective optimization.arXiv preprint arXiv:2406.16232","venue":"arXiv (Cornell University)","work_id":"4711764f-d344-4191-acbd-4f2e75a07b53","year":2024},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"cited_paper":"/paper/2406.16232","citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:b2e5c67cbb36db5f7cd42a5f2542fcef851fc45f69f39b4b81841a28fdc4ec86","observation_id":"7b7d486c-8c12-468b-8535-fa52955b9979","resolution":{"observed_at":"2026-05-11T03:15:55.022903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unpreju- diced training auxiliary tasks makes primary better: A multitask learning perspective.IEEE Transactions on Neural Networks and Learning Systems, 36(7):12091–12105","venue":null,"work_id":"4ad0c9df-ed34-47d4-acd6-14b21366adb0","year":2024},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:f34a343658634338b880e9b1f63f8d58d43e586ce01b96d5a177dc11324d2a0c","observation_id":"3ed88404-e0f5-4a8b-822e-f83ffb33990d","resolution":{"observed_at":"2026-05-14T10:54:13.586063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample-level weighting for multi-task learning with auxiliary tasks: E","venue":null,"work_id":"4bac3638-a2a3-4a6e-9de0-a61e51a8f6e9","year":2024},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:823807d8e4f65b7425f3c775ee6d5525d137cb61ac58527bf56a8ace10bfe7d5","observation_id":"0f74a29c-1303-41f3-be3d-89f3ca3b4493","resolution":{"observed_at":"2026-05-14T10:54:13.579138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.08585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ldc-mtl: Balancing multi-task learning through scalable loss discrepancy control.arXiv preprint arXiv:2502.08585","venue":null,"work_id":"55c7c05a-816c-4c3a-b02a-eec46ff8a7e9","year":2025},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:eacd39dd87adb5d7eeffba32665b1e03e54743de459f5ebc7a18bcc3e9ec1586","observation_id":"0c60dbb2-a7cc-47f9-8246-07777fb4facb","resolution":{"observed_at":"2026-05-11T03:15:55.016588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02224","last_updated":"2020-11-25T19:33:00Z","snapshot_observed_at":"2026-08-14T17:47:51.883746Z","submitted_at":"2018-12-05T21:00:44Z","title":"Adapting Auxiliary Losses Using Gradient Similarity","version":2},"cited_work":{"arxiv_id":"1812.02224","doi":"10.48550/arxiv.1812.02224","metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02224","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adapting auxiliary losses using gradient similarity","venue":"arXiv (Cornell University)","work_id":"c9540fa6-e8bb-4c8c-9755-c17a594c7cf7","year":2018},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"cited_paper":"/paper/1812.02224","citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:1b3db19469e2f668484981cb7c879dc2c7ce33fb048772f4ffd1dba580ecedcb","observation_id":"70316813-0b1e-4947-ac4e-0fdb89d36d78","resolution":{"observed_at":"2026-05-11T03:15:54.976625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:07:17.677201+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:07:17.677201+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive auxiliary task weighting for reinforcement learning.Advances in neural information processing systems, 32","venue":null,"work_id":"e6388ccb-660c-4ea6-8174-834c35d17d41","year":2019},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:759f6f6e98b44ded81e4894c33eb08f19e57f19cd3c1503ff1d8eb86f750257a","observation_id":"7515c056-cec7-4240-a474-e02ae21a7d3a","resolution":{"observed_at":"2026-05-14T10:54:13.581058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"5796aa7d-d2bb-4531-ade6-2f8ed46191ed","year":2015},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:b51b89aa4490c4bdc5a202820897826efe0ae42a4fd9dcb98c1982d1a597933b","observation_id":"5d287b56-00e7-41e7-b5ae-33d9f74398b2","resolution":{"observed_at":"2026-05-14T10:54:13.587909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-08-14T20:41:41.185318Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T03:11:37.361024Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.07756"},"observation_digest":"sha256:a07cfea3583cccd7606c9bff5321a6edfeb37b5f89a39d1946100c0a9356ebf7","observation_id":"05852816-1d02-49e7-9687-aca73fbcff49","resolution":{"observed_at":"2026-05-11T03:15:54.991024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07756","last_updated":"2026-05-08T13:59:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T13:05:56.722830Z","submitted_at":"2026-05-08T13:59:19Z","title":"When Losses Align: Gradient-Based Composite Loss Weighting for Efficient Pretraining"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":6,"verified_fuzzy":28},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2605.07756."}